🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

UEmbed: Unified Sparse and Dense Multimodal Embeddings

upvotes:29 · 评分 84 · Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie · 原文链接 ↗

Decoder-only统一多模态稀疏+稠密嵌入,兼容agent场景

UEmbed是一个decoder-only多模态嵌入模型,通过附加N个可学习的special tokens并将词表划分为N个子集,在单次因果前向中同时产出稀疏和稠密表示,避免了传统两阶段或模块拼接。在MMEB-v2上,UEmbed-9B达到71.8(dense)和71.0(sparse),优于公开数据训练的同类模型;BEIR上也具备竞争力。作者还展示了在检索效率与agentic应用中的实用性。

  • 对于导购agent,稀疏检索可提升工具调用与记忆检索的可解释性,且decoder-only架构与现有LLM技术栈一致,有望统一表示层。
  • 改变了原先认为稀疏检索必须依赖encoder或双塔的认知,UEmbed为单一模型同时支持dense/sparse与多模态提供了新范式。
  • 下一步:读全文,重点看稀疏token的设计细节与训练数据规模;若与我的记忆系统匹配,可跑benchmark对比现有方案。
归档评分 84 · 当日排名 #5