
基元律动发布模型NeoHorse,探索Harness驱动的RSI路径
1小时前
基元律动(TokenRhythm)联合无问芯穹、清华大学、北京大学、阿里巴巴等机构,推出首个Agent-Native模型NeoHorse-1,包含4B和9B两个版本,探索将Agent使用工具、接收反馈和修正错误的经验转化为模型能力。
基元律动由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办。公司此前开发的开源Routing Harness系统OpenSquilla,用于在Agent执行任务时选择和组织不同模型。NeoHorse将这条技术路线延伸至模型训练。
据技术报告,训练语料以包括OpenSquilla在内的Routing Harness产生的执行轨迹为核心,并辅以公开数据。这些轨迹保留了能力需求预测、路由选择、模型响应、工具调用和环境反馈,经完整性检查及目标完成、证据一致性、错误恢复等质量评估后,用于后训练。
团队利用路由信号估计任务所需能力、安排训练顺序,并结合Agent执行监督和在策略蒸馏(On-Policy Distillation)更新模型。其中,在策略蒸馏由教师模型针对学生实际生成的内容提供指导。
报告在11项涵盖Agent执行、工具交互、代码和指令遵循的基准上进行了评测。报告所列的4B级模型中,NeoHorse 4B的未加权平均分最高,并在五项基准上超过Qwen3.5-9B底座。改善主要集中在流程清晰、反馈可观察、结果可验证的任务上;更大模型在复杂状态维护、长程调试和失败恢复中仍有优势。
这一过程是递归自我改进(RSI)的单轮工程验证:Agent执行轨迹,评测暴露能力短板,训练选择随之调整,模型完成更新并重新返回Harness。
对基元律动而言,NeoHorse现阶段的意义,在于为其技术设想提供模型层面的证据。此次合作也为这一探索提供了持续迭代的基础:让开源模型进一步学习任务执行中的经验,并检验Harness与模型协同改进的潜力。
格隆汇声明:文中观点均来自原作者,不代表格隆汇观点及立场。特别提醒,投资决策需建立在独立思考之上,本文内容仅供参考,不作为实际操作建议,交易风险自担。
10.6k