# ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
- 来源：huggingface · https://huggingface.co/papers/2607.29677
- 作者：Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

> 首个综合评估企业文档schema引导抽取的基准，衡量值精度、记录完备性、溯源与成本。

## 概要

ExtractBench 是一个针对企业文档中 schema 引导抽取任务的基准测试，首次同时评估值精度、记录完备性、溯源（grounding）和成本。它包含 370 份企业文档、4869 页，覆盖 8 个业务领域、67 种文档类型，并标注了不同的挑战场景。构建数据时采用独立系统一致性、合成列表已知值、人工验证表单三种策略。结果发现：商业 VLM 在短文档上表现良好，但在长文档上常截断记录列表；编码 agent 准确率更高但成本显著；LlamaExtract Agentic Plus 在所有指标上排名第一，准确率与编码 agent 相当，成本却低得多。

## 对我的影响

1. **直接用于导购/agent 产品**：我们正在开发基于 LLM 的 agent，涉及从商品描述、发票、说明书等文档中抽取结构化信息。ExtractBench 的评估体系（值精度、记录完备性、溯源、成本）可直接借鉴，用来评估和优化我们的抽取流程，特别是长文档场景下的稳定性。\n2. **技术选型参考**：结果说明商业 VLM 在长文档上存在截断问题，而编码 agent 成本高。我们可以考虑 LlamaExtract Agentic Plus 这类方案，平衡准确率和成本，或采用类似的 agent 架构（如工具调用+代码生成）来提升抽取的完整性和可靠性。\n3. **接下来行动**：阅读论文全文和代码，了解数据构建方法，尝试在导购场景的文档上运行 ExtractBench 评估我们的方案，并关注 LlamaExtract 后续进展，看是否集成到我们的技能库中。

---
*导出自 前沿论文情报台*