HUGGINGFACE
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
无批判器的递归自蒸馏,将稀疏奖励转为回合级信用分配,提升agent RL性能。
概要 / Summary
AgentOPSD提出了一种无需critic的递归方法,用于agentic RL中的回合级信用分配。它通过聚合token级教师-学生log概率差,在log-odds空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。在ALFWorld、WebShop和Search-QA上使用Qwen2.5-3B/7B评估,优于GRPO和强自蒸馏基线,ALFWorld成功率89.1%。消融实验表明,回合级聚合和依赖历史的递归更新是关键。
对你的影响 / Impact
对于我的导购agent,多轮对话中的关键决策如商品推荐或说服时机可受益于此方法,提升长对话中的决策质量。
此方法无需额外critic和rollout,兼容标准策略优化,降低RL落地成本,可能改变我对复杂奖励设计的依赖。
后续应详细阅读全文,评估在Qwen2.5-7B上复现的可行性,并在我的多轮导购场景中尝试应用。
归档评分 88 · 当日排名 #4