🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

upvotes:58 · 评分 92 · Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai · 原文链接 ↗

从教程视频等多模态资源自动蒸馏可复用的Agent技能。

RESOURCE2SKILL 是一个从教程视频、代码仓库、文章等人类创建的多模态资源中,自动提取并构建可执行技能库的框架。它将技能组织为层次化的多模态 Skill Wiki,每条技能包含结构化文本、代码、视觉示例和元数据。在7个创作领域测试中,使用该技能库的Agent平均得分比无技能基线高11.9%,并在28个主聚合模型-领域组合中26个优于强基线。消融实验验证了多模态格式、层次结构、来源多样性、选择策略和在线获取的价值。

  1. 直接可用于我的导购Agent产品:导购场景经常需要从视频教程(如产品使用演示)或文章中提取可复用的操作技能(如“如何比较两款手机相机”)。RESOURCE2SKILL的框架可以整合到我的情报系统和Agent中,自动从导购相关视频、博客、问答中构建技能库,提升Agent的零样本操作能力。
  2. 改变了我的判断:之前我认为技能库主要靠手动编写或从Agent轨迹抽象,而该论文证明了从人类制作的多模态资源(尤其是视频)中自动蒸馏技能是可行且有显著收益的。这促使我考虑将YouTube导购视频、开箱测评等作为技能源纳入技术选型。
  3. 下一步行动:先读全文,重点关注其多模态编码细节和技能检索/组合策略;如果框架开源,计划在我的导购Agent中复现一个针对“产品比较与推荐”的轻量级技能wiki;持续关注其在线技能获取机制能否与当前RAG系统结合。
归档评分 92 · 当日排名 #2