henry 发自 凹非寺 量子位 | 公众号 QbitAI仙桃储罐保温厂家
刚刚,闭源 RSI 的钦点严父来了!
开源 AI 基础步伐公司 Prime Intellect 在新的项商讨中提议:
借助多智能体 Harness,可以把监控和具体罢了交给小、低廉的开源模子,,从而让" AI 修复 AI "变得低廉,以至果好。
在实际中,他们把 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3 等 18 个前沿模子,扔进了场 nanoGPT 化器速通。
效果,开源权重模子 Kimi K3 搭配 Prime Agent Harness 后,在原始效果页中跑出了 2930 步的收获。
这不仅过了 GPT-5.6 Sol 的 3042 步,距离 Claude 的旗舰模子 Opus 5 的 2920 步也只差 10 步。
换句话说,在 AI 商讨这件事上,套由开源模子和 Harness 构成的系统,还是概况过部分顶闭源模子,以至迫临梯队。
这面运行径摇昔日阿谁经典的 RSI 脚本:
某个强闭源模子领先跨过" AI 修复 AI "的临界点,然后束缚自我迭代,把其他玩越甩越远,终赢通吃。
另面,Prime Intellect 也展示了另种可能:
模子不定非得强,只须底下这套科研机器虚耗,开源模子一样可以靠的试错迷糊量追上来。
而这,也跨越展示了 Harness 这类 Agent 编排框架,在 AI4AI、AutoResearch 上的后劲。
这是如何作念到的?
nanoGPT 化器速通
肤浅来说,此次 Prime Intellect 的实际,即是让十几个前沿大模子,去速通 Karpathy 那套的 nanoGPT 磨真金不怕火任务。
不外先澄盘货。
此次并不比谁能臆造发明个何等原创的新算法。
Prime Intellect 作念的,是胜利把 AI 扔进个目表明确、响应快速的着实磨真金不怕火任务里,看它能不可像东说念主类商讨员样,束缚提议假定、跑实际、看效果,再延续往下改。
Agent 运行会拿到份带有 baseline 参数的磨真金不怕火脚本,同期只取得个领导:当前这套案还不够好。
至于那处能变好,如何变好,没东说念主告诉它:
究竟是换种好的预条目法,给权重和新幅度加上限和下限,退换学习率 schedule,让学习率保抓得久,如故在磨真金不怕火后期加入权重平均,齐得靠 Agent 我方点点试出来。
是以,这些实际到后齐只看个方针:
用尽可能少的 training steps,把个 1.24 亿参数 GPT 的考据集 loss 降到 3.28 以下。
为了让大从同条起跑线开赴,Prime Intellect 把 baseline 定在了 3290 步。
动作参照,当前公开的好记录则是东说念主类的 2600 步。
于是呢,所有这个词比赛就酿成了从 3290 步开赴,看谁能把这个数字压得低。
压得越低,证据它找到的磨真金不怕火 recipe 越,也就越接近顶东说念主类商讨者还是作念到的水平。
具体的仙桃储罐保温厂家,参与测试的包括 Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5、GLM 5.2、Muse Spark 1.1、DeepSeek V4 Pro、Grok 4.6、Muse Spark 1.2、Qwen 3.8 等野心 18 个前沿模子。
每次启动之后,Agent 会拿到三样东西:代码仓库、份法例手册,以及条标的指示。
实际统运行在 8 张 H200 上,从这里运行,东说念主类基本退出。
改化器、写代码、启动磨真金不怕火、相比 loss、判断效果是不是噪声、决定下轮实际作念什么,透彻由 Agent 我方完成。
值得提的是,为了止它们胜利上网抄现成谜底,所有这个词过程还被锁进 sandbox,而且断网。
实际考据
终,Prime Intellect 共跑了 153 次全自主实际,单次长抓续过 8 天。
然后,他们先得出了个若干有点扫兴的论断:
莫得任何次实际,提议了信得过酷好上的全新法。
终有的那些招数,论是 normalization、学习率退换、权重平均如故多样 optimizer 手段,基本齐能在已有商讨里找到类似想路。
但也正因为大后找到的 idea 差未几,另个征象反而变得明:
信得过把模子拉开差距的,不是猜度什么,而是如何把它试出来。
这里我们先放几个论断:
强模子不会纵欲把个 idea 判死刑。
弱模子时常个 seed 跑差了就烧毁,铁皮保温施工强模子会换 seed、从头消融,以至等 recipe 变了以后,再把旧案捡追忆重测。
Opus 5 从头调 β 2 后刷出了新记录,Fable 5 次从头探伤旧案,又省下了 31 个 steps。
强模子会处理噪声。
它们会先判断个小擢升到底来自着实蜕变如故赶快波动,再决定值不值得延续算力。
以至有模子发现,同个 seed 类似跑,loss 也会因为 GPU 非细则发生变化,随后胜利围绕这个征象重作念实际进程。
强模子还会我方造用具。
Kimi K3 会我方写实际函数、相比 loss 弧线、归附 baseline,以至搭个微型数值实际室,先考据 Newton-Schulz,再把论断带回着实磨真金不怕火。
而跑得远的 Fable 5,终作念到 2726 步。
从 3290 步 baseline,到 2600 步的东说念主类记录,中间共有 690 步化空间。
Fable 5 还是吃掉了 564 步,很是于走完其中大致 82。到这里,此次实际信得过故酷好的地才出来。
因为若是十几个模子后猜度的东西齐差未几,那么至少在这种商讨任务里,idea 自己可能莫得大遐想中那么稀缺。
信得过影响收获的,反而是能不可多试几个向,能不可快摒除诞妄,能不可收拢那些很弱但着实存在的信号,再把它们轮轮叠起来。
换句话说,科研才调运行越来越像个试错迷糊量问题。
而这,也正值解说了 Prime Intellect 为什么接下来把放到了 Multi-Agent Harness 上。
既然多半使命齐落在写代码、跑实际、盯效果、作念考据这些本领,那么就没必要每步齐调用贵的前沿模子。
可以让低廉的开源模子认真监控和罢了,把信得过需要判断的本领留给强的模子。
这么来,一样的钱能跑多实际,一样的实际也能快跑完。
而当次试错越来越低廉,AI 科研才调的擢升,也就不定非得等下个强的大模子。
把底下这套"试错机器"造得好,自己就能延续把收获往上。
是以 Prime Intellect 下步还准备把 Speedrun 扩展到磨真金不怕火栈的多本领,同期延续放大实际鸿沟。
从这个角度看,Multi-Agent Harness 信得过想加快的,也不仅仅 nanoGPT。
它想加快的是 AI 研发自己的迭代速率。
这其实还真有点像 OpenAI 商讨员翁翌之前在 Why Not TV 里提到的个判断:
关于东说念主类商讨员来说,idea 自己往往很低廉。
大能猜度的向,可能并莫得遐想中差那么多。
信得过拉开差距的是 infra(基础步伐)的迭代速率——谁能快、稳地考据主见、修 bug、跑实际,谁就能赢。
而放到 AI4AI 里,酷好可能也样。
我们偶而需要每步齐让个其颖悟、其不菲的模子切身下场。
许多时候,信得过需要科罚的是:
如何让个还可以的模子,以虚耗低的本钱,把实际轮回跑得虚耗快。
这时候,低廉的开源模子 +Harness,反而运行出势。
而且值得提的是,在 Kimi K3 的测试中,恰是 Prime Intellect 自的 Prime Agent Harness 给模子提供了个抓久运行的 IPython 内核,让它们可以围绕商讨任务,我方搭建和迭代套使命流。
而这套内核也让 K3 得以在实际中,可以主动翻我方的假定,从而提率。
这件事看起来仅仅个小,但放到 RSI 里,其实很弊端。
因为若是模子的才调短期内莫得倏得跳升,那么接下来容易延续膨大的,可能恰恰即是模子外围的科研基础步伐。
让它领有万古辰的使命状况、顺遂的实际用具、低廉的推广模子,以及概况同期跑多假定的 Multi-Agent 系统。
后取得的,不定是个倏得"才略爆炸"的模子。
也可能是台越来越低廉、越来越快、越来越不知疲惫的 AI 科研机器。
而若是 AI 修复 AI 终真要插足指数加快,Prime Intellect 给出的这条路子至少提醒了件事:
决定速率的,偶而唯一上头阿谁模子有多颖悟。底下那套让它束缚试错的机器,一样蹙迫。
参考衔接
[ 1 ] https://www.primeintellect.ai/blog/measuring-autonomous-research
[ 2 ] https://www.primeintellect.ai/blog/prime-agent
键三连「点赞」「转发」「防范心」
接待在驳倒区留住你的主见!地址:大城县广安工业区相关词条:离心玻璃棉 塑料挤出机 钢绞线厂家 铝皮保温 pvc管道管件胶
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。