304永利集团官网入口-3.8万小时、狂烧天价token:字节发现Agent的 Scaling Law
首页财产ai正文 3.8万小时、狂烧天价token:字节发明Agent的 Scaling Law 7月2日字节Seed发布Agent评测项目EdgeBench,让模子于生疏情况运行12小时,找到Agent的Scaling law,还有搭建试验平台,鞭策评测范式改变 2026-07-08 14:41 ·硅星人 Ado Ado AI投资人解读· EdgeBench搭建试验平台,让5个前沿模子跑约38,000小时,找到Agent的Scaling law。发明agent进修有数学公式发展路径无尺度“从头理解问题”鞭策前进进修速率自己于进化。还有开源双容器框架SForge。· 搭建平台资源耗损年夜,长程Agent评测入场门坎高给Agent反馈多易被使用。总结:EdgeBench结果显著,对于AI成长意义庞大,但面对资源及防做弊挑战,为AI下半场提供新思绪,凸显连续进修情况的主要性。
7月2日,字节 Seed 发布了一个 Agent评测项目 EdgeBench。看起来又是一个 benchmark,但它问了一个其他榜单不问的问题。

给模子一道题,做对于了患上分,做错了不起分。这是绝年夜大都 benchmark 此刻的事情方式,愈来愈像高考。
但真实世界里,人不是这么用 AI 的。
你不会给 Claude Code出一道题然后等它交卷。你会给它一个项目、一个代码库、一批数据,然后它于那里折腾好几个小时,摸索、犯错、读反馈、批改、再试。你更体贴的是它浸泡于实际使命情况里一段时间以后,能不克不及比刚进来时更强。
但当前的 benchmark 险些测不出这些工具。它们丈量的是静态能力,模子被冻结的那一刻就知道的工具。至在从反馈里连续前进的能力、于长周期里堆集经验的能力、于生疏情况里探索出标的目的的能力,全于盲区里。
EdgeBench 的暗语就是把盲区里的工具放进评测,解答一个问题:把Agent扔进一个生疏情况,12小时后,你能变强几多?
为此,Seed 团队搭了一个叫 EdgeBench 的试验平台。这是一个情况进修不雅察舱。134 个使命,每一个使命设计合约让 Agent至少跑 12 小时。
它的设计缭绕四个焦点维度睁开:

5 个前沿模子(Claude Opus 4.八、GPT-5.五、GPT-5.四、GLM-5.一、DeepSeek-V4-Pro)于上面统共跑了约38,000 小时。
经费于燃烧。但终极的成果价值巨年夜:
他们找到了 Agent 的 Scaling law。
0一、四个发明:公式、路径、素质、速率
1 )agent进修有一条被写死的数学公式
这是全篇论文的“魂灵发明”。
此前咱们年夜多默许情况进修是一件杂乱的事,差别使命、差别模子、差别计谋,纪律天然也差别。但他们的数据给出了意料以外的谜底:
134 个使命的平均进修曲线,被统一个函数以 R² = 0.998 的精度切确拟合。
R² = 0.998 是甚么意思?于人机交互及繁杂体系研究里,你能看到 R² = 0.3 就已经经敢写论文了。0.998 素质上不是一个"拟合问题",这是一个发明。假如我知道一个 Agent 前两小时的前进速率,于使命调集的平均意义上,我就能比力正确地猜测它 12 小时后的程度。
曲线展示被测模子的进修体感年夜致都是:一最先慢、找到觉得后发作、靠近天花板时又放缓。这及任何有过深度进修或者深度事情经验的人的体验彻底吻合。
并且,这个纪律跨标准建立:不管是 12 小时、28 小时还有是 72 小时的试验窗口,拟合精度全数连结于 R² ≥ 0.993。跨范畴同样成立:六年夜使命家族各自拟合,R² 于 0.972 到 0.998 之间。
2)没有“尺度”的发展路径
这个发明更有现实意义。
把 134 个使命的单使命进修曲线拉开来看,你会发明一件反直觉的事:虽然平均曲线是美丽的 log-sigmoid,但单条曲线之间不同极年夜。
- 有的使命:Agent 一上来就稳步晋升,曲线洁净
- 有的使命:前几个小时岿然不动,忽然于某个时刻分数跳升
- 有的使命:先涨后跌再涨
- 有的使命:一最先快速上升,然落伍入漫长的平台期
差别的进修计谋及试错范式,于统一个评分框架下会孕育发生大相径庭的发展路径。
Agent不只是“学患上快”及“学患上慢”的区分。它们于怎么学上有素质差异,假如是只看终极分数而不看历程的评测方式,就彻底抹平了这个维度。论文的注释是,使命是一张能力求,进修是解锁前沿向外扩张,于对于数时间上走一条logistic曲线。单使命节点少以是锯齿,使命够多平均后S形浮现。论文标题里阿谁scaling law,指的就是这条曲线。
3)“从头理解问题”创造真前进
统一个模子(Opus 4.8),一样的 12 小时预算:
-方案 A:让它持续跑 12 小时,所有中间产品、过错记载、已经验证假定全数保留
-方案 B:拆成 6 次自力的 2 小时跑,每一次清空所有状况,只保留最 佳成果
12 小时后,方案 A 比喻案 B 多了 6.9 分(百分制)。并且两条曲线从一最先就各奔前程。
这申明前进不是靠命运多试出来的,而是靠经验堆集出来的。
值患上存眷的是试验中的引力波重修案例研究。GPT-5.5 于这个使命上跑了 12 小时,提交了 224 次,但真正鞭策最 佳成就前进的只有27 次提交。
每一一次冲破都不是由于"多跑了一个试验",而是由于 Agent对于问题自己的理解发生了质变。它把恍惚的方针慢慢拆解为可搜刮的子问题,从反馈中从头界说了"甚么是更好的标的目的"。
4)进修速率自己正于被“进修”
这个发明多是跟财产瓜葛最慎密的一个。
试验挑了一组所有模子“起跑线相近”的使命(初次测验考试都于 6.87 分摆布),然后丈量每一个模子于2 小时交互后能前进几多。
成果:从 2025 年 9 月的GPT-5-Codex到 2026 年 4 月的GPT-5.5,221 天内进修效率晋升了约 8 倍,约每一 3 个月翻一番。
后期模子的有用提交率于上升,但提交次数纷歧定更多。换句话说,不是更勤快,而是每一次动手更有用。这及工程实践的直觉一致,高级工程师纷歧定比低级工程师写更多行代码,但更少做无用功。
AI 的能力愈来愈像“常识”,但"学会新工具"的能力自己,也于以惊人速率进化,并且这个速率比静态常识增加更有决议性。
0二、评测情况自己,及EdgeBench一样有价值
EdgeBench 看起来像一个模子排行榜,但它测到的不是裸模子能力,而是 Agent 体系能力。
差别模子跑于差别的履行框架上。Claude Opus 4.8 利用 Claude Code 加 1M 上下文窗口,GPT-5.5 利用 Codex 加 256K 紧凑窗口。末了的分数,既包罗模子自己的能力,也包罗上下文治理、东西挪用、反馈处置惩罚及履行框架的影响。
这反而靠近真实部署。实际中的 Agent 从来不是一个伶仃模子,而是模子、东西、事情流及反馈体系的组合。EdgeBench 真正权衡的,是这个组合体系能不克不及于长程使命里连续推进。
但这也象征着,榜单不克不及被粗鲁理解成基础模子排名。它更像是于比力差别 Agent 体系的持久事情能力。
把EdgeBench及主流 benchmark 放于一路看,差距会更清晰:
传统 benchmark 是“静态快照”,EdgeBench 是“动态轨迹”。它们不是于统一个维度上竞争。
但这个新维度不是没有价钱的,暗地里是巨年夜的资源耗损。
及EdgeBench一样让我印象深刻的工具,是把这个试验情况搭起来象征着甚么。
先说一组轻易被纰漏的账。134 个使命,每一个使命平均耗损 57.2 小时的人类专家时间,最长的单个使命投了 320 小时。纵然按最 低尺度估,光使命构建这一项就投入了 7,500 小时以上的人力;然后是运行成本,5 个模子,每一个模子于每一个使命上跑 3 次,加之延伸至72小时以上的运行,每一次 12 小时,共计约 38,000 小时的 Agent 交互时长,对于应的是天文数字的 API 挪用及算力耗损。
这个成本门坎自己就象征着,长程 Agent 评测不是随意一个团队就能入场的标的目的。
再看工程细节。论文的附录记载了于开发历程中被 Agent 攻破的各类缝隙:有 Agent 于流体力学使命中经由过程 400+ 次提交反推出了隐蔽测试数据的谜底;有 Agent 发明反做弊查抄对于 baseline/ 目次宽免,在是把代码塞进那条“免检通道”里交卷。这些案例袒露了一个深层的抵牾:想要测出“进修能力”,就必需给 Agent 充足的反馈;但反馈给患上越多,就越可能被 Agent 当做预言机来使用。
EdgeBench 的解决方案是物理断绝:事情容器及裁判容器分隔,裁判打完分就销毁,避免Agent“做弊”:
EdgeBench 的双环反馈机制:左侧是 Agent 可以自由摸索的事情容器,右侧是隐蔽裁判,提交后才返回权势巨子评分
事情容器:Agent 于内里随意折腾,编译器、调试器、日记、文档全都有,但没有“隐蔽谜底”
裁判容器:Agent 提交工件后,裁判用隐蔽测试数据及私有评分尺度来打分,打完容器马上销毁
这个设计很讲求,素质上是于模仿“科场密封”及“双盲评审”的机制。把这个从工程层面做对于,难度比设计标题问题自己年夜患上多。这套双容器框架有本身的名字,SForge。字节把它连同134个使命中的51个一路开源了,构建情况的门坎还有留于原地,利用它的进口已经经打开。
于做 benchmark 的人看到这,年夜概城市有一种“本来你们也被Agent坑过”的共识。
这也是为何 EdgeBench 让我觉得它不是“一个新的 benchmark ”,更可能是一种新的软件评测体系。
它素质上是一个可不雅测的 Agent 运行情况。你把它当做“Agent 的 profiler”,可能比“一个新 benchmark”更正确。
把这个视角拉回到行业:当前年夜部门 Agent 评测还有逗留于“于某个测试集上一次性跑分”的阶段。EdgeBench 花了这么年夜价钱搭一个长程试验装配,它想回覆的问题实在很简朴,但很主要。
0三、字节本身的“AI下半场”
EdgeBench是一个让人从头想问题的理由。
长程使命及短 benchmark 之间的不同,不是时间拉长了,而是袒露出来的问题彻底差别。一个只跑 10 分钟的 benchmark,Agent的举动是可以预期的:读题、思索、输出、竣事。不会出甚么幺蛾子。但当你把时间拉到 12 小时,贫苦就多了。Agent 会于标的目的准确的条件下逐步跑偏,修睦一个模块的同时弄崩另外一个;会看不懂用户的反馈,把一个过错旌旗灯号误读成另外一个标的目的,然后于过错的路上连续投入几小时。
退一步想“是否是标的目的错了”,当前的 Agent于这方面还有有短缺。这些问题于短 benchmark 里很难被不雅测到,但于真实情况中,件件致命。
是以,EdgeBench 的价值就是把 Agent 评测的尺度从“会不会做”推进到了“会不会连续做、进修、再做”。这两个问题之间,隔着一次评测范式的代际超过。
对于评测的范式的从头思索,总让人想到今朝于腾讯卖力模子的姚顺雨曾经提出的“AI下半场”的判定,某种水平上,EdgeBench 就是字节本身版本的“AI下半场”。
EdgeBench 把“Agent于情况里越跑越强”这个直觉酿成了可丈量的进修曲线。逻辑是同构的,只是此次标准再也不是参数及算力,而是时间及反馈。
将来 AI 公司争取的焦点资源,不只是数据及算力,还有有能让模子重复试错、连续进化的情况。
【本文由投资界互助伙伴硅星人授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-304永利集团官网入口




