HUGGINGFACE
A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
冻结12B模型+可验证记忆库,实现零token精确求解,颠覆传统训推范式。
概要 / Summary
本文提出一种将LLM冻结、在其旁构建可验证记忆库的方法。一旦某类问题被求解并通过独立验证(不参考标准答案),之后的所有同类问题都可以零生成token、比特精确、确定性回答。在9个问题族、180个新实例上,四种不同架构的模型均达到180/180准确率。记忆选择只需1.4微秒,完全复用耗时6-23毫秒、能耗36mWh。近似检索在4500条记忆上错误率94.3%,而精确寻址零错误。记忆还能作为工作上下文,支持单GPU 600万token移动窗口,而vLLM/SGLang仅支持3-3.2万token。在已求解并验证的问题上,API模型每次查询需完整生成,而本系统零token返回相同结果。
对你的影响 / Impact
- 对导购/agent产品的直接影响:导购场景中常见高频重复查询(如商品规格、比价、退换货规则)。若能将这类问题的标准答案经过验证后存入记忆库,后续用户提问可直接复用,无需调用LLM生成,大幅降低延迟和成本。这与当前LLM agent的“每次推理”模式形成对比,可能改变产品中的技术选型——在固定知识类问题上优先使用记忆库,而非万能但昂贵的LLM。
- 改变了我哪个判断:过去我认为LLM的能力提升只能通过训练或微调实现。本文证明,通过外部可验证记忆,冻结模型也能在特定领域超越前沿模型。这提示我将更多注意力从持续跟进模型训练转向构建“验证-记忆-复用”的闭环,尤其是在产品中高频出现且答案可验证的场景。
- 接下来该做什么:1) 仔细研读论文细节,特别是验证步骤的设计和记忆寻址机制;2) 在自己的导购数据上设计一个类似的原型,验证可行性;3) 关注该方法的可扩展性——当记忆库规模扩大后,寻址冲突和验证成本如何演化。
归档评分 85 · 当日排名 #5