HUGGINGFACE
DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces
异构工作区数据代理基准,KDD Cup 2026官方评测,最佳准确率66%
概要 / Summary
DataSpace 是一个新基准,用于评估数据代理在异构工作区(含 CSV、JSON、SQLite、PDF、视频等)中执行自然语言分析并生成可验证表格结果的能力。它包含410个跨语言任务和7439个工件(15GB),并采用确定性评估器进行表格对齐和比较。实验显示,六个前沿多模态模型最佳准确率仅66.34%,且多模态证据整合和连接操作会一致降低所有后端的准确率,表明该基准仍有大量提升空间。该基准用于KDD Cup 2026数据代理竞赛。
对你的影响 / Impact
与导购/agent产品的关联:虽然DataSpace聚焦于表格分析而非对话式导购,但其核心思想(从异构数据源中检索、整合证据并生成结构化输出)与导购agent需要从产品库、用户历史、长文档中提取信息类似,可借鉴其评估方法论和任务设计。
改变的技术判断:多模态证据整合会降低准确率,提示在多模态场景中需谨慎设计agent的推理流程,避免盲目集成多种数据源。
后续行动:阅读DataSpace-Builder的实现细节,尤其关注其数据生成和评估逻辑,以优化我们自己的agent评估框架。
归档评分 92 · 当日排名 #2