🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

upvotes:66 · 评分 90 · Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen · 原文链接 ↗

开源CUA轨迹奖励模型,低成本可替代商用VLM裁判

OSReward 是一个评估 VLM 作为 computer-use agent (CUA) 轨迹裁判的基准,发现现有 VLM 裁判普遍存在宽松偏差,且高性能模型成本过高。为此,作者构建了 OS-Shepherd-100K 语料并训练了开源奖励模型 OS-Shepherd(9B/35B),以 30-60% 的成本达到商用裁判的可靠性。该工作对 CUA 的评估、数据筛选和 RL 训练有直接影响。

  • 可用性:OS-Shepherd 可作为我们导购 agent 中多步任务执行的自动评估器,替代昂贵的人工审核或不可靠的 VLM 裁判,用于筛选高质量轨迹数据或作为 RL 奖励信号。
  • 判断改变:之前认为 VLM 裁判是低成本方案,但 OSReward 揭示其宽松偏差可能严重高估 agent 成功率,需要谨慎使用;开源模型与商用差距也提醒我们选型时要评估成本-可靠性平衡。
  • 下一步:跑通 OSReward 基准和 OS-Shepherd 模型,在导购场景中构建小规模数据集,比较它与 GPT-4o 等裁判的一致性;同时跟踪该领域后续工作。
归档评分 90 · 当日排名 #3