# SAAG: Structured Agent Assessment and Grounding
- 来源：arxiv · https://arxiv.org/abs/2607.18245
- 作者：Ritvik Garimella, Vedant Khandelwal, Anvi Kohli, Amit Sheth

> 解构Agent调用错误为三阶段，提升诊断与自修复能力。

## 概要

SAAG提出级联诊断框架，将Agent调用评估拆解为注册符合性、结构完整性和参数准确性三个阶段，每个阶段生成可解释的诊断信号。该方法还可用于迭代自修复：根据阶段信号进行精准修正。在Glaive函数调用数据集的多个agent规模和参数量小于4B的模型上，结构化反馈持续提升了参数准确度并减少了值幻觉，但端到端F1提升有限且依赖模型。

## 对我的影响

- **可直接用于导购/agent产品**：SAAG的分阶段诊断能帮助我们快速定位tool-use错误是“选错工具”还是“填错参数”，从而设计更细粒度的失败处理逻辑，提升用户对话体验。
- **改变了技术选型判断**：之前我对小型模型的agent调用可靠性持怀疑态度，但SAAG在sub-4B模型上的正效果让我考虑在低延迟场景下使用更小模型+结构化反馈，而非一味追求大模型。
- **接下来该做的动作**：在个人论文情报系统中增加SAAG论文的追踪标签；阅读全文并尝试将分阶段诊断思路应用到我们的导购agent评测流程中，评估是否值得集成。

---
*导出自 前沿论文情报台*