🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

Thought-Level Beam Search for Reasoning

upvotes:14 · 评分 85 · Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali · 原文链接 ↗

用beam search在thought级做推理,算力分配更高效。

Gambit是一种推理算法,通过thought-level beam search来优化test-time compute分配。它定期剪枝低质量轨迹,并立即从高质量前缀分支,用轻量评分器探测隐状态,从而动态集中计算资源。在相同硬件约束下,相比基线,Gambit在HMMT-24和AIME-25上分别提升了6.7%和3.3%的准确率,吞吐量提高2倍,token消耗减少68.5%。

  1. 对导购agent的影响:该算法可提升推理效率,若引入可让导购agent在有限算力下更精准地生成推荐路径,尤其适合多步骤决策场景。
  2. 对技术选型的影响:验证了在推理阶段通过beam search分配计算资源优于传统并行采样,未来设计agent推理管线时可考虑类似思路。
  3. 下一步:阅读全文,重点看其轻量评分器如何实现,尝试在小规模任务中复现,评估效果。
归档评分 85 · 当日排名 #3