HUGGINGFACE
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
在线轨迹提炼技能→自我进化,用token级蒸馏提升Agent RL
概要 / Summary
SEED提出了一个自演进的在线策略蒸馏框架,专门用于Agent的强化学习。它在RL过程中,让当前策略模型将完整轨迹分析成自然语言「技能」(如可复用workflow、观察模式、失败规则),然后利用技能对动作概率的改变,生成密集的token级蒸馏信号与稀疏的轨迹级奖励联合优化。在文本和视觉Agent任务上,SEED显著提升了性能和样本效率,且泛化到未见场景。
对你的影响 / Impact
- 导购Agent产品:该框架可以让我在RL训练中自动提取导购场景下的优秀话术或决策流程(如推荐策略、追问时机),直接用作技能库,既提升了学习效率,又为SkillOS提供了天然的技能来源。\n2. 技术选型判断:之前更倾向off-policy蒸馏或纯结果优化,SEED证明了on-policy自蒸馏的有效性,且技能以自然语言形式存在,可解释性强,我会把这种方法纳入后续agent训练pipeline的备选。\n3. 接下来行动:读全文+跑代码,重点验证其技能提取质量和对多步对话的适应性;如果效果符合预期,可能集成到导购agent的在线学习模块中。
归档评分 91 · 当日排名 #2