🔒 只读 demo · 仅可导出MDWord
BLOG

Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction

publisher:BAIR · 评分 85 · 原文链接 ↗

用“信念状态”监督摘要训练,让LLM长交互更省内存、效果更好。

ABBEL 提出将每轮总结显式建模为“信念状态”(belief state),并引入信念评分(belief grading)机制——通过重构损失来监督摘要中的信息含量。在协作编程、猜词和多目标QA三个场景中,ABBEL 相比传统递归摘要,能将全上下文模型的性能差距缩小约一半,且训练步数减少50%,同时峰值token数显著降低。

  1. 导购/Agent产品可用:当前导购agent在多轮对话中上下文增长过快,ABBEL的信念状态方法可以直接用于压缩历史,节省推理成本。尤其适合需要记忆用户偏好和产品对比的导购场景。
  2. 改变判断:之前认为递归摘要的效果瓶颈在数据量,ABBEL表明“监督摘要内容”比单纯增加数据更关键,这启发我在项目中可以尝试类似的重构损失来训练摘要模块。
  3. 接下来做什么:准备在导购agent的对话存档模块中,用GPT-4模拟实现信念状态的雏形(轮次摘要+关键信息提取),验证效果后再考虑用ABEL方法微调小模型。
归档评分 85 · 当日排名 #4