
英伟达把AI省钱的开关开源了。
9月11日,英伟达正式开源了自家的Harness——SoL-Pi。它把Pi作为底盘,在上面重造了一套效率增强层,让AI实现自我迭代和优化。在这套自动化流水线里,AI自己当上了研究员:观察Agent怎么干活,找出哪些步骤在白白烧Token,提出方案、修改bug,再把方案送进测试。
实测结果相当惊人:Token消耗最高省64%,API调用成本骤降50%到54%。在专业研究场景下,每小时可直接省下8.75美元到13.5美元。安装只需要一行代码。
当前编程智能体的任务越来越长,从补几行代码到跨仓库修复问题,单次任务可以持续数小时。一些平时不起眼的Token浪费会不断累积:改完文件,明明下一步就是跑测试,模型还要再推理一轮;一个大文件早已读过,后续请求仍在反复携带它;几千行日志里真正影响决策的可能只有几行,昂贵的模型却要从头读起。
递归自我改进同样绕不开这笔开销。AI每尝试改进一次系统都要花Token,失败的方案也照样收费。SoL-Pi要解决的就是这件事。
和底座Pi相比,SoL-Pi少用45%到49%的Token,成本低大约三分之一,平均得分保留94%左右。和Codex、Claude Code原配的Harness相比,Token少35%到64%,标价成本低50%到54%。
英伟达的流水线最终留下了四个机制,刀刀避开主干,专治重复劳动。
第一层是动作融合。在基础Pi的运行轨迹里,最常见的序列是修改文件、收到结果,然后再调用命令去测试或构建。既然后续命令已经非常明确,中间这轮模型的一来一回就有了极大的压缩空间。SoL-Pi直接把编辑和后续命令封装进同一个本地执行序列,Harness在底层完成修改、运行命令,再把合并后的结果一次性返回。
第二层是在线上下文压缩。上下文越长,历史材料越容易变成算力与资金负担。但压缩也有代价,重写上下文可能会打断已有的KV-cache复用。SoL-Pi把大任务拆分为子任务,每完成一步就重新评估。只有当未来预计省下的开销能够覆盖本次重写的成本时,系统才会真正执行压缩。
第三层是输出归档与索引。一个大文件首次读取后如果一直滞留在上下文里,后续每一轮请求都会原样携带它。SoL-Pi的做法是把完整内容归档到本地磁盘,上下文里只留一个稳定的短句柄和一小段摘录。模型需要查阅细节时,直接根据索引按页取回。
第四层是小模型初筛日志,引入严格的证据核验。构建和测试日志动辄上万字,真正影响决策的往往只有几行报错。SoL-Pi把长日志的第一遍阅读委派给成本更低的模型,但要求它输出一份紧凑的诊断回执,系统再拿着回执逐条与归档的原始日志比对。只有严丝合缝对得上的原文,才会被放行交给前沿大模型。
为什么是这4个机制?这得说到英伟达真正的野心——递归自我改进。
既然AI能改代码,也应该能改造生产AI的系统。但RSI太烧钱,每一次试错都要付Token费。于是英伟达换了个目标:先别急着让AI更聪明,先让它更省钱。
相比直接追分,Token效率更难作弊。刷任务分数很容易过拟合,给特定题目写规则就行;但删重复上下文、压缩工具输出、合并无效决策,这些优化能迁移到不同任务和模型。
于是,一条Agent研究Agent的流水线启动了。团队先搭出535个可验证环境,再让AI提出152个优化方向,随后经过三轮筛选:先用历史轨迹估算收益,没潜力的直接淘汰;再让AI自己改代码、跑实验,并由Reviewer Agent挑刺;最后冻结方案,在完全隔离的任务上验真,能力不能掉,效率必须涨。152个想法,最终只活下来4个,平均约40个才能出1个。
SoL-Pi背后,是MIT副教授、英伟达研究总监韩松掌舵的Efficient AI团队。对他们来说,SoL-Pi当前省下了多少Token开销,不过是一个阶段性注脚。他们真正看重的,是这条AI研究AI的飞轮还能转多大。
在官方项目主页中,团队还埋下了两个长线伏笔。一个是闭环预训练:目前的535个环境依然是人工构建的,未来将由Agent自己去全网收集任务、搭环境、验证、更新自己的Harness。另一个是效率复利:用变省了的Harness去跑规模更大、成本更低的自动研究循环,进而找出更高效的机制,形成成本压缩的复利效应。
在这个飞轮里,人只负责在初期提供先验方向;一旦进入循环,从研究到验证全程零干预;等AI把机制跑通了,人再回来搞清楚AI到底发现了什么。
现在,模型的Scaling Law各家还在争论不休;但Harness的Scaling Law,已经有人开始抢跑了。而那个在赛道上狂奔的,是AI自己。