🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

AREX: Towards a Recursively Self-Improving Agent for Deep Research

upvotes:141 · 评分 92 · Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao · 原文链接 ↗

递归自我改进的深度研究Agent,通过验证驱动迭代搜索。

AREX提出了一个递归自我改进(RSI)框架,用于深度研究任务。其核心思路是利用“发现-验证”不对称性:验证候选答案比直接发现更易分解为约束检查。AREX包含内循环(收集证据、构建临时答案)和外循环(逐约束审计、定位未解决项并启动定向研究)。它学习了一个自适应的上下文更新工具,将交互历史压缩为改进状态,无需外部模型。通过agentic中训练和长程强化学习,模型在BrowseComp、DeepSearchQA、HLE等基准上显著超越同规模基线,并与使用更多激活参数的模型竞争。关键创新在于对关键步骤(决定性证据或错误纠正)进行奖励强化,缓解长程学习中的稀疏奖励问题。

  1. 直接用于导购Agent:AREX的递归自我改进机制可以迁移到导购场景——用户需求往往包含多个约束(价格、品牌、功能),通过验证当前推荐是否满足各约束来迭代优化推荐结果。可借鉴其‘上下文更新工具’思想,压缩对话历史为结构化状态,减少长程对话中的信息丢失。\n2. 技术选型启示:AREX证明开源模型(4B/122B MoE)通过针对性训练可逼近闭源大模型性能,强化了在导购Agent中优先采用可定制、可本地部署的MoE模型的判断。接下来应深入论文细节,重点关注其对‘关键步骤奖励’的实现方式及context update tool的具体设计,考虑在项目中试点类似机制。\n3. 情报平台改进:AREX的RSI框架可被用于自动化论文分析:先初筛论文,再逐约束验证(如‘是否提出新方法’、‘是否有开源代码’、‘与我项目的相关性’),然后针对低分项做定向细读。这能显著提升情报整理效率,接下来可以基于当前平台实现一个简化版原型。
归档评分 92 · 当日排名 #3