解析人大高瓴ClawGym II框架,利用黑盒强化学习通过真实Agent Harness(如OpenClaw、Claude Code)持续优化模型,实现跨异构系统的能力提升与通用性增强。
当Agent Harness变得复杂,模型该如何从中学习?ClawGym II提出了一种黑盒强化学习框架,无需修改Harness内部实现,直接利用真实交互轨迹优化底层策略模型,让Agent在复杂环境中持续进化。

一、黑盒RL挑战与核心思路
将真实复杂的Agent Harness纳入强化学习闭环,并非简单的技术叠加,而是面临三重严峻挑战。最直观的问题是执行稳定性:大规模并发rollout极易遭遇延迟波动与异常中断,若缺乏可扩展且稳定的基础设施,训练进程将频繁停滞。其次,碎片化轨迹的优化难题同样棘手。黑盒轨迹往往导致多轮交互细节不可见,加上训练环境与推理环境的不一致,使得从中提取有效训练信号变得异常困难。最后,跨异构适配的成本高昂,不同Harness的内部逻辑差异巨大,如何以较低成本实现统一训练,是阻碍通用性提升的关键瓶颈。
针对上述痛点,ClawGym II的核心思路在于解耦。它将Harness执行与策略优化彻底分离:Harness保持其原生执行逻辑,不被外部训练逻辑侵入;而训练系统则通过在模型服务边界部署Serving Proxy,精准捕获输入/输出token及log-probability。这种架构使得模型能在不改动Harness内部代码的前提下,直接从真实交互中汲取反馈。后续章节将详细展开这一机制在沙箱隔离与轨迹重建中的具体实现。
二、Sandbox隔离执行与数据捕获
解耦架构的落地,依赖于一个高隔离度的执行环境。ClawGym II为每个任务动态创建临时Sandbox,确保Harness在独立的资源空间中运行。这种按需创建与即时释放的机制,不仅保证了并发任务间的环境隔离,更让大规模并行rollout成为可能,避免了状态污染对训练稳定性的干扰。
在工具交互层面,框架通过MCP协议无缝接入网页搜索等通用能力及特定任务工具。这一设计彻底解除了对Harness工作流的侵入式修改,使得模型能够直接利用现成的工具链进行推理。与此同时,部署在模型服务边界的Serving Proxy扮演了数据捕获器的角色,它精准记录每一轮交互的输入token、生成token以及rollout阶段的log-probability,并同步关联任务元数据。这些原始数据构成了后续轨迹重建的基础素材。
训练闭环的最后一环由Verifier完成,它根据任务结束时的最终环境状态计算奖励值,为策略优化提供明确的目标信号。考虑到长时程训练中的不确定性,系统还内置了容错机制,自动处理超时与异常中断,确保训练进程的连续性。这套执行与捕获机制,为下一章将展开的前缀树轨迹重建提供了完整且可靠的数据支撑。
三、前缀树轨迹重建与优化
上一章构建的Sandbox环境与数据捕获层解决了“怎么跑”和“怎么记”的问题,但黑盒Harness产生的调用记录本质上是碎片化的。模型在一次复杂任务中可能触发多次API调用,若直接将其视为独立样本进行训练,会严重割裂上下文逻辑。ClawGym II通过前缀树轨迹重建机制,将这些离散记录还原为具有因果关联的完整多轮对话流。系统以Task-Harness Pair为单位,将同一次rollout中的所有模型调用组织成树状结构:相同的历史交互被合并为公共前缀节点,而不同的执行路径则保留为独立分支。这种结构不仅恢复了工具返回结果在对话中的真实位置,更清晰地区分了模型在不同决策点上的行为差异。
然而,原始轨迹中往往包含噪声。为了提升训练信号的质量,框架引入了严格的轨迹过滤策略。由重试机制产生的死路分支(dead leaves)会被自动移除,因为它们代表了无效的计算开销;同时,上下文压缩(context compaction)及子智能体(subagent)等难以精确归因的辅助轨迹也被剔除,确保参与优化的每一段轨迹都能直接反映主策略模型的决策质量。这一清洗过程显著降低了梯度估计的方差。
在损失计算环节,前缀树结构带来了显著的效率优势。传统的线性轨迹处理会导致共享历史部分被重复计算,而在树状结构中,共享前缀的Loss仅计算一次,各分支独有的Token则分别参与策略更新。这种去重机制不仅节省了算力,更避免了模型在相同历史序列上产生冗余学习。针对这一一对多的树状数据结构,GRPO算法被适配为在Task-Harness Pair内部进行组内优势估计,从而在保持训练稳定性的同时,有效支撑了异构环境下的策略优化。这种对轨迹结构的深度利用,为后续章节中训练-推理一致性的保障奠定了基础。
四、训练-推理一致性与混合训练
前缀树解决了轨迹的结构化还原问题,但黑盒训练的核心挑战在于确保训练时的输入分布与推理时严格一致。ClawGym II采用了Black-box Token-in-Token-out策略,在架构上解耦了“Harness视图”与“训练视图”。推理引擎生成的原始token被直接捕获并用于后续训练,未经过任何中间层的格式化或规范化处理。这一设计至关重要,因为任何额外的清洗或重组都可能引入数据偏差,导致模型在实际部署时出现“分布外”(out-of-distribution)行为,从而削弱黑盒训练的有效性。
为了解决因离线数据记录带来的概率偏差,框架引入了token-level importance-sampling rollout correction。通过对每个token的概率进行精细校正,该方法有效降低了off-policy bias,使得基于历史轨迹的策略更新更加准确和稳定。在此基础上,ClawGym II进一步提出了Mix-Harness Training机制。该机制以Task-Harness Pair为基本实例,将来自OpenClaw和Claude Code等不同异构Harness产生的rollout随机混合进入同一个batch进行共同优化。这种混合策略不仅打破了单一Harness的局限,还迫使共享策略模型在多样化的交互模式中寻求更通用的解,从而显著提升了Agent跨系统的鲁棒性与泛化能力,为后续的通用性分析提供了坚实基础。
五、实验验证与通用性分析
Mix-Harness Training 机制旨在解决跨系统泛化问题,但理论上的优势必须通过实证数据来背书。ClawGym II 选取 Qwen3-30B-A3B 作为骨干模型,在 OpenClaw 和 Claude Code 两大真实 Harness 环境下进行了严格验证。实验结果显示,黑盒 RL 策略带来了显著的性能跃升:在 PinchBench 基准上,ClawII-OC-30A3B 模型得分提升了 11.71 分,而 ClawII-CC-30A3B 的提升幅度更是高达 17.28 分。这表明,即便在不接触 Harness 内部代码的前提下,模型依然能高效习得特定环境的交互逻辑。
更具说服力的是其通用性表现。采用共享策略模型进行混合训练后,该模型在两个异构 Harness 上均保持了与各自单 Harness 专用模型相当的 Reward 和评测表现,证明了框架在跨系统迁移中的稳定性。此外,在新任务扩展测试中,模型在 JobBench-Easy 上的得分由 20.46 升至 27.20,在 OfficeQA-Full 上则从 8.53 大幅跃升至 21.54。这一结果有力证明了 ClawGym II 不仅局限于单一任务,而是具备跨任务形式的稳定优化能力。与传统的白盒训练相比,直接通过目标 Harness 进行黑盒 RL 显然更能适应复杂且动态变化的执行机制,为构建通用型 Agent 提供了更稳健的技术路径。