🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

Recursive Synthesis for Long-Horizon Terminal Tasks

upvotes:222 · 评分 95 · Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang · 原文链接 ↗

递归合成终端任务数据,25倍降价且难度可无限攀升

RST提出一种递归验证的合成框架,从已验证的种子任务出发,通过扩展参考解、重校准验证器和指令,并在沙箱中验证,生成大量长时程终端任务。经过15轮递归,产出37,484个任务,单任务成本约0.05美元,远低于人工成本。任务难度随轮次显著增加,参考解中位数从67行增至374行,执行命令数从40增至244,DeepSeek-V4-Pro pass@4从90%降至2.5%。用这些任务微调Qwen3.5,在Terminal-Bench等基准上提升显著,且递归未见天花板。

  1. 对导购agent的启示:RST的递归合成+验证思路可直接迁移到导购对话数据的生成——用已验证的对话流程作为种子,递归扩展(如增加商品比较、多轮砍价等),并自动重验证,可低成本生成海量高质量训练数据。值得设计一个类似pipeline供训练使用。
  2. 改变了对合成数据的判断:之前认为长时程任务数据必然昂贵,RST证明通过递归和验证可以大幅降本且保持一致性。这推动我在数据生产上更依赖自动化验证,而非纯人工或直接LLM生成。
  3. 下一步行动:深入阅读RST代码,重点关注其验证器重校准机制,尝试在小规模导购场景复现;同时跟踪后续是否出现跨领域(非终端)的递归合成研究。
归档评分 95 · 当日排名 #1