编辑 | 泽南 Agent 完成任务后,学到的经验去了哪里? 一个 Agent 接到项目排期任务,它找到了工作目录里的文件,大致理解用户想要什么,却漏读了一封包含最新消息修改的邮件。随后,它沿着过时信息继续规划,生成了无效排期,最后还把文件写到了错误位置。 执行链在中途断掉,随后就全是基于错误推理的错误答案。看到之后,你显然会让 AI「重新审视问题」再生成一遍。问题在于,下一次怎么办? 今天的大多数系统中,Agent 的经验都留在日志里,模型每天在真实环境里产生的执行经验,几乎从不进入模型参数。这意味着模型下一次遇到相似任务,依旧可能踩一遍同样的坑。 基元律动最近发布的 NeoHorse-1 试图改变这件事。他们开源了 4B 与 9B 两个尺寸的模型,训练出来的思路听起来有点绕:让一个本来负责给模型「派活」的路由系统,顺便把所有模型走过的路记录下来,再把这些路教给一个小模型,让它自己就能走完一群模型走过的路。 论文链接:https://arxiv.org/abs/2609.08183 HuggingFace:https://huggingface.co/collections/TokenRhythm/neohorse-1 GitHub:https://github.com/TokenRhythm/NeoHorse 这件事, 被他们称为迈向 RSI 的第一次闭环验证 该模型由无问芯穹提供底层基础设施支撑与 Infra 优化技术能力,清华大学、北京大学团队参与算法和训练方法研究,共同探索提升 Agent 后训练的数据利用效率和训练效果。 大模型的终极目标:自我迭代 RSI(Recursive Self-Improvement,递归自我改进)是 2026 年 AI 领域一个炙手可热,也富有争议的词汇。它的愿景并不复杂:让 AI 把自己的产出作为经验重新喂回研发流程,参与设计更强的下一代自己,循环往复、自我升级。 今年 6 月,Anthropic 发布《When AI builds itself》,称在内部观察到了 RSI 的早期迹象。这个星期,OpenAI 发布博客首次公开了自己 RSI 的进展。OpenAI 称,其已经实现去年秋天定下的目标:在今年 9 月前造出一个「自动化研究实习生」。 但 Anthropic、OpenAI 自己也承认完整的 RSI 时代尚未到来,甚至不会必然发生。学术界今年涌现的一大批工作,从 Self-Harness、Continual Harness 到各类自我进化基准,大多还停留在「改进某个零件」的阶段。 人们争议的焦点很具体:AI 巨头口中的 RSI 目标很远大,实际操作起来却是个外界无法检查的黑箱。你既看不到训练数据如何流转,也复现不了那个闭环,最后只能选择相信或不相信。 在已经大规模应用的 AI Agent 上,工程层面的自我迭代也一直在进行中。对于 Harness 来说,决定表现的并不只在于底层模型。就像 DSH 之于 DeepSeek V4 Pro,一个设计得当的 Harness 才可以让模型发挥全部潜力。 当前,Agent 领域出现了两条并行演进路线。一条是在推理时更新外部系统,例如把成功经验写入 Memory、Skill 或 Harness;另一条则更进一步,让 Harness 框架直接参与模型训练。 NeoHorse-1 尝试用最简单的方式来实现训练的正循环,让我们看到了一个清晰可行的流程,它用的模型是 Qwen3.5 4B 和 9B,再把一个自我改进闭环拆成了四个可以逐环检查的零件,并全部开源。 要看懂它,得先从一个叫 OpenSquilla 的路由系统讲起。 Harness 框架,天然就是 AI 训练场 几个星期前,基元律动开源的 Harnes 框架 OpenSquilla 为这家公司基础设施层的创新开了个头。OpenSquilla 专注于通过高效率和低 Token 成本来运行和调度复杂的智能体任务,目标直指 Agent 落地的核心痛点。 一个复杂任务往往要跑数十轮,每一轮都调用最贵的旗舰模型,token 会顶不住。OpenSquilla 的做法是在 Harness 框架上装一个「路由器」,每执行一步之前先判断这一步需要多强的能力,再分派给够用且最便宜的那个模型或模型组合。按 benchmark 测试结果,这套机制可以省下 60% 到 80% 的 token 开支。 到这里,主要还是在想办法省钱。NeoHorse 的进一步洞察在于,路由器在派活的每一步都留下了三样东西:它预判了这一步需要什么能力、记录实际派遣的模型,还要观察这一步最终执行得怎么样。 换句话说,人与 AI 聊天的记录主要包含「问题 — 答案」,Routing Harness 产生的则是「需求预测 — 路由决策 — 执行过
发表评论