返回知识库
0

title: "Harness 基座模型 JIT-27B,为每个任务写一套“Claude Code”"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI1MzEwMzIwOQ==&mid=2247518825&idx=1&sn=3be4697c9daf3d2e36373f32af8d5938"
author: "青稞AI"
excerpt: "公共早报 JIT-Agent-27B 是一个由新加坡国立大学开发的 Harness Intelligence 基座模型,它能够为每个具体任务即时生成定制化的执行框架(harness),并学习如何修复失败结构和优化性能。"


原创 青稞编辑部 2026-08-28 00:00 河北

配图

新加坡国立大学LV-Lab推出了JIT-Agent-27B,一款Harness Intelligence基座模型。它面向具体任务即时构造一套完全根据任务定制化的 harness,并学习如何修复失败结构、如何依据执行反馈继续改进。

配图

主页:http://qingkeai.online/



作者:Guibin Zhang

青稞社区为科研人员提供成果宣传支持,如有优秀研究成果分享推广,欢迎投稿联系:*aiFreeCode*


Agent benchmark 通常把模型视为能力的主要来源,但同一模型只要更换记忆组织、规划协议、工具暴露方式或错误恢复流程,最终表现就可能跨越一个明显的档位。

这样的差异来自 Agent Harness:它定义模型在什么状态中推理、通过什么接口行动,以及一条轨迹如何被推进到完成。

新加坡国立大学LV-Lab推出了JIT-Agent-27B,一款Harness Intelligence基座模型。 JIT-27B以Agent的Runtime运行层为训练对象。

它面向具体任务即时构造一套完全根据任务定制化的 harness ,并学习如何修复失败结构、如何依据执行反馈继续改进。任务定制样本、故障恢复轨迹,以及奖励、延迟和成本信号都通过训练更新模型权重。部署时,模型再把参数中积累的结构经验转换为当前任务的可执行程序。

论文标题:JIT-Agent:Scaling Harness Intelligence via Just-in-Time Harness Evolution
论文主页:https://bingreeky.github.io/JIT-site  
代码仓库:https://github.com/bingreeky/JIT    
模型与资源:https://huggingface.co/JIT-Agent

结果直接呈现了 harness 所能贡献的能力增量。在 GLM-5.2 与 DeepSeek-V4-Flash 上,18 组同模型、同 benchmark 对照全部提升。DeepSeek-V4-Flash 配合 JIT-generated harness 后,在 DeepSearchQA 上超过 GPT-5.6(+9.1);GLM-5.2 即使已经具备较强 Agent 能力,单项增益仍可达到 20.2。 配图 Table 3:九项 Agent benchmark 的整体结果

Table 3 固定 backbone,将实验变量收束到运行方式本身。结果提供了模型参数与推理预算之外的观察角度:Agent 的能力上限也受到运行结构的直接塑造。

Harness作为可生成的运行时表示

为了让模型能够生成完整 runtime,JIT-Agent 把 harness 统一表达为四个模块。

  • • Memory 负责证据、历史与中间状态;

  • • Planning 维护下一步目标;

  • • Action 定义控制循环与恢复路径;

  • • Capability Orchestration 决定当前可调用的工具、API 和技能。

四个模块共同形成一份包含状态与控制语义的可执行协议。 配图 任务经由四模块协议被编译为专属 harness

图1|JIT-Agent的生成接口。 输入任务经过 Memory、Planning、Action 与 Capability Orchestration 的组合,得到面向具体问题的执行结构。

这套表示还连接着 HarnessFactory。ReAct、ReSum、Flash-Searcher、HiAgent、ROMA、AOrchestra 等 13 种 scaffold 被重新实现到同一协议下,使原本分散的运行时成为可比较、可组合的结构样本。共同接口让 JIT-Agent 学习跨 scaffold 的结构规律,并据此选择和重组运行机制。

Insight|可组合性把 runtime 变成模型可以操作的对象 《A Programming Paradigm for Spatiotemporal Composability》[1]把依赖关系置于 DeepSeek Harness 的组织中心,并用 "Everything is a Plugin" 为每个运行单元赋予可组合的位置。 JIT-Agent 进一步将模块接口转化为生成约束。模型面对的是具有类型和依赖关系的组件空间,harness synthesis 由此获得稳定的结构语义。

论文把这种能力定义为 Harness Intelligence 。它由三部分组成:针对任务形成合适结构的 adaptivity,从编译和执行故障中恢复的 reliability,以及利用真实结果推动设计改进的 evolvability。相应地,模型的角色也从动作生成器延伸为运行系统的构造者,即 Model-as-a-Harness 。

让Agent为每个任务定制化写一套"Claude Code"

JIT-Agent-27B 的训练围绕 harness 的生命周期展开。系统先建立任务到运行结构的映射,再把失败执行转化为恢复经验,最后依据环境返回的效果与成本信号优化候选设计。 配图 JIT-Agent-27B从定制、修复到演化的训练过程

图2|三阶段Harness学习。 Customize、Repair 与 Evolve 分别对应结构生成、故障恢复和 frontier 推进。

在 Customize 阶段,教师监督提供任务适配的 harness,价值加权偏好学习进一步区分高任务收益、低延迟和低成本的方案。Repair 阶段把编译错误、接口不一致、工具失败与运行异常组织成短程修改轨迹,使模型学习诊断与补丁之间的对应关系。

Evolve 阶段采用 Evo-GDPO,让同一任务下的一组候选 harness 与 archive 中的 incumbent 比较,并分别归一化奖励、延迟和成本信号。

这些训练过程共同改变 JIT-Agent-27B 的参数。模型权重保存跨任务复用的构造与修复规律;archive 记录近期执行中形成的优秀实例,为后续生成提供参考。部署期间权重保持固定,长期参数知识与运行时 archive 在不同时间尺度上协同工作。

同一协议可以生成完全不同的程序

Palimpsest 和 Trapdoor 展示了任务条件如何进入 harness 内部。Palimpsest 服务于联系人整理、工作簿生成和邮件交付组成的跨应用任务。它把任务编译成制品依赖图,通过受限并行完成发现、过滤、构建和发送,并把中间产物写入持久化 memory。

Trapdoor 面向多跳身份研究。它动态生成子问题,通过有步数上限的 delegate 调用启动私有研究分支,再将返回事实纳入 FactGraphMemory。一个 runtime 围绕 artifact DAG 运转,另一个围绕受控递归和证据图运转;二者共享模块接口,却拥有不同的状态结构与控制语义。 配图 以依赖图管理制品生产的 Palimpsest 配图 以受限子 Agent 完成多跳研究的 Trapdoor

图3|任务条件化的Harness实例。 JIT-Agent根据任务需求改变规划、记忆、行动循环和能力暴露方式。

这些案例也说明,task-conditioned harness 的含义超出 prompt 改写。生成结果会改变数据结构、工具策略、执行顺序、并行宽度和验证条件,进而改变基础模型处理长程任务的方式。

性能、成本与迁移实验

固定 backbone 后比较不同 harness,可以进一步分离模型能力与运行时贡献。对 DeepSeek-V4-Flash 和 Qwen3.6-Flash 的六组受控设置中,JIT-Agent 在四组取得最高任务表现;全部六组均使用最少 token,并产生最低 API 成本。以每组费用最低的固定 harness 为基准,平均单例成本减少 36.0%。 配图 Table 4:固定 backbone 下的 advanced harness 对照

Table 4 还揭示出固定 scaffold 的任务依赖性:某个 harness 在一个 benchmark 上领先,换到另一类任务时可能明显回落。即时生成将选择发生的时间推迟到任务已知之后,使模型能够依据当前问题构造运行方式。

六个不同尺寸的 backbone 来自 DeepSeek V4、Qwen3.6 与 MiMo-V2.5。它们与 ReAct 构成的 24 组配对实验全部获得正向增益,平均提升 7.6 分。JIT-Agent-27B 参数中的结构先验因而能够跨越模型家族和规模,为不同 backbone 形成有效 harness。

Harness Intelligence带来新的Scaling对象

模型参数决定推理与生成的基础能力,harness 决定这些能力在环境中如何被组织。JIT-Agent-27B 将后者纳入模型训练,使 scaffold synthesis、repair 和 evolution 成为可以积累、迁移和复用的参数能力。

这也为模型与 harness 的共同设计提供了新的接口。生产系统可以继续保留稳定内核,把记忆策略、规划方式、能力编排或局部控制交给模型按任务生成。随着更多运行经验进入 foundation model 的训练过程,Agent scaling 将同时发生在模型本身与承载模型行动的系统之中。

引用链接

[1] 《A Programming Paradigm for Spatiotemporal Composability》: https://github.com/cordiverse/paper 往期推荐 配图 自进化也能"左脚踩右脚"?Google 最新提出 EnvHarness:环境自进化,倒逼 Agent 疯狂进化! 配图 将 Harness 引入评测领域!HarnessEval 开启评测新时代,让 Agentic Benchmark 持续进化 配图 当 Agent 失败时,别急着怪模型:HarnessFix 如何从失败轨迹中修复 Harness 配图 Models、Harness 和 Artifacts,到底是什么在进化?普林斯顿博士后拆解 Agent 自进化的三层分类体系



加入青稞AI技术交流群


加入青稞AI技术交流群,不仅能与来自MIT、港中文、CMU、UCLA、斯坦福、清华、阿里、腾讯 等名校名企AI研究员/开发者一起进行技术交流,同时还有一线青年AI研究员/开发者的Talk分享、青稞Tea、论文精读、招聘内推、国内外硕/博申请、大模型技术报告解读等。备注:姓名+学校/公司+方向,暗号"AI "优先审核通过!

配图

都看到这了,点个关注再走吧🧐~

AI知识库 / Harness 基座模型 JIT-27B,为每个任务写一套“Claude Code” 0 字 0 行 iliuqi
2026-09-04T08:55:45.151220127Z 2026-09-04T09:38:51.268587282Z