Reward design and RL loops for multimodal LLMs 多模态大模型的奖励设计与 RL 闭环
Farsight extends RLVR credit assignment from instant visual dependence to future-discounted visual grounding; Med-Banana turns success-and-failure trajectories into DPO-ready post-training signal. Farsight 将 RLVR 信用分配从「即时视觉依赖」扩展到「未来折扣视觉锚定」;Med-Banana 将成败轨迹转化为可直接用于 DPO 的后训练信号。


