🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

upvotes:85 · 评分 91 · Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng · 原文链接 ↗

在线轨迹提炼技能→自我进化,用token级蒸馏提升Agent RL

SEED提出了一个自演进的在线策略蒸馏框架,专门用于Agent的强化学习。它在RL过程中,让当前策略模型将完整轨迹分析成自然语言「技能」(如可复用workflow、观察模式、失败规则),然后利用技能对动作概率的改变,生成密集的token级蒸馏信号与稀疏的轨迹级奖励联合优化。在文本和视觉Agent任务上,SEED显著提升了性能和样本效率,且泛化到未见场景。

  1. 导购Agent产品:该框架可以让我在RL训练中自动提取导购场景下的优秀话术或决策流程(如推荐策略、追问时机),直接用作技能库,既提升了学习效率,又为SkillOS提供了天然的技能来源。\n2. 技术选型判断:之前更倾向off-policy蒸馏或纯结果优化,SEED证明了on-policy自蒸馏的有效性,且技能以自然语言形式存在,可解释性强,我会把这种方法纳入后续agent训练pipeline的备选。\n3. 接下来行动:读全文+跑代码,重点验证其技能提取质量和对多步对话的适应性;如果效果符合预期,可能集成到导购agent的在线学习模块中。
归档评分 91 · 当日排名 #2