🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

upvotes:100 · 评分 95 · Mind Lab, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao · 原文链接 ↗

Macaron-V1:冻基座+LoRA专家,实现持续学习与自改进的开放agent模型

Macaron-V1是一个面向持续学习的开放agent模型家族,核心是Mixture-of-LoRA(MoL)架构:冻结基座模型,组合多个特化LoRA适配器,每轮用户选择其中一个。旗舰Venti基于744B GLM-5.2,加上chat、agent、coding、GenUI四个LoRA;Tall版本基于Qwen3.6(50B)用于本地部署。算法上采用Model-Harness Co-design和递归自改进循环,包括UI4A(GenUI harness)、状态化动作基座、HCP契约和agentic RL框架MindForge。基础设施包括后训练平台MinT、长上下文RL方法LongStraw和稀疏MoE稳定性技术。评估显示在Personal Intelligence、GenUI和通用能力基准上达到前沿水平,但持续学习和集体智能的复合收益仍是开放问题。

  1. 架构借鉴:MoL的'冻结基座+多个特化LoRA'与我的agent产品中'通用能力+领域技能'的需求高度契合。可以低成本地为导购场景添加专门的'购物助手'LoRA,而无需重训基座。这改变了我的技术选型思路——从微调整个模型转向维护可组合的LoRA集合。
  2. 持续学习机制:Model-Harness Co-design和递归自改进循环提供了一种从真实环境反馈中持续更新模型的方式。这对agent产品尤其重要——生产环境中的交互数据可以持续提升性能。我打算深入了解其HCP契约和自改进细节,看能否复用到我们的agent评估闭环中。
  3. 下一步行动:先读全文,重点关注MoL的调度策略(如何选LoRA)和MindForge的RL流程。如果可行,将尝试在Qwen3.6上实现一个简单的MoL原型,用于导购场景的专长切换。
归档评分 95 · 当日排名 #1