# UEmbed: Unified Sparse and Dense Multimodal Embeddings
- 来源：huggingface · https://huggingface.co/papers/2608.02583
- 作者：Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

> Decoder-only统一多模态稀疏+稠密嵌入，兼容agent场景

## 概要

UEmbed是一个decoder-only多模态嵌入模型，通过附加N个可学习的special tokens并将词表划分为N个子集，在单次因果前向中同时产出稀疏和稠密表示，避免了传统两阶段或模块拼接。在MMEB-v2上，UEmbed-9B达到71.8（dense）和71.0（sparse），优于公开数据训练的同类模型；BEIR上也具备竞争力。作者还展示了在检索效率与agentic应用中的实用性。

## 对我的影响

- 对于导购agent，稀疏检索可提升工具调用与记忆检索的可解释性，且decoder-only架构与现有LLM技术栈一致，有望统一表示层。
- 改变了原先认为稀疏检索必须依赖encoder或双塔的认知，UEmbed为单一模型同时支持dense/sparse与多模态提供了新范式。
- 下一步：读全文，重点看稀疏token的设计细节与训练数据规模；若与我的记忆系统匹配，可跑benchmark对比现有方案。

---
*导出自 前沿论文情报台*