🔒 只读 demo · 仅可导出MDWord
HUGGINGFACE

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

upvotes:181 · 评分 95 · Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang · 原文链接 ↗

固定GPU预算下实现百万token级RL后训练,突破长上下文瓶颈。

LongStraw提出一种架构感知的执行栈,在固定GPU预算下(8块H20)实现百万token级的RL后训练(如GRPO)。通过分离共享prompt的autograd、仅保留后续token所需的状态、逐条回放短响应分支,显著降低实时训练图大小。实验在Qwen3.6-27B和GLM-5.2上验证了2.1M token量级的执行能力,且仅增加少量显存开销。目前主要验证执行容量,训练完整性尚未完全验证。

  1. 直接用于导购/Agent产品:我的agent需要处理长轨迹(多轮对话、工具调用、上下文积累),LongStraw的长上下文RL后训练能力可直接用于优化agent的决策长链,提升记忆和工具调用效果。
  2. 改变技术选型判断:之前认为长上下文RL受限于GPU预算,需要近似或分级策略;LongStraw证明固定预算下也能做到百万token,让我重新考虑在导购场景中直接使用完整长轨迹进行强化学习,而不是缩短或截断。
  3. 接下来行动:读全文,重点关注其分离prompt和回放机制的实现细节,评估是否能在我们现有的LLM(如Qwen、GLM)上复现;如果可以,计划在小规模导购任务上实验,验证对长轨迹agent的收益。
归档评分 95 · 当日排名 #1