Bloom
Bloom
发现
书架
空间
论文、材料,或你的问题
发起研究
加载中…
💬
反馈
Distribution-wise Reward:当奖励不看个体看分布——视觉生成模型 RL 微调的反直觉解法