HUGGINGFACE
UEmbed: Unified Sparse and Dense Multimodal Embeddings
Decoder-only统一多模态稀疏+稠密嵌入,兼容agent场景
概要 / Summary
UEmbed是一个decoder-only多模态嵌入模型,通过附加N个可学习的special tokens并将词表划分为N个子集,在单次因果前向中同时产出稀疏和稠密表示,避免了传统两阶段或模块拼接。在MMEB-v2上,UEmbed-9B达到71.8(dense)和71.0(sparse),优于公开数据训练的同类模型;BEIR上也具备竞争力。作者还展示了在检索效率与agentic应用中的实用性。
对你的影响 / Impact
- 对于导购agent,稀疏检索可提升工具调用与记忆检索的可解释性,且decoder-only架构与现有LLM技术栈一致,有望统一表示层。
- 改变了原先认为稀疏检索必须依赖encoder或双塔的认知,UEmbed为单一模型同时支持dense/sparse与多模态提供了新范式。
- 下一步:读全文,重点看稀疏token的设计细节与训练数据规模;若与我的记忆系统匹配,可跑benchmark对比现有方案。
归档评分 84 · 当日排名 #5