304永利集团官网入口-AI当老板,快给10家公司干破产了
首页财产ai正文 AI当老板,快给10家公司干停业了 普林斯顿年夜学让AI运营虚拟SaaS草创公司500天,14位选手中大都吃亏,仅4个保住本金,Fable 5夺冠,研究患上出摸索>审慎等结论 2026-06-29 15:37 ·微信公家号:量子位 Jay Jay AI投资人解读· 普林斯顿年夜学让AI运营虚拟SaaS草创公司,14位参赛选手中仅4个保住本金,Fable 5收益最高,达4715万美元。GPT-5.5及Claude Opus 4.8也有不错体现,还有有一个纯rule-based算法进入前四。研究发明摸索新计谋比守旧打法更容易盈利,且编程Agent用在CEO脚色可能受限。 · 行业竞争激烈,AI决议计划面对诸多不确定性编程Agent与特定场景适配问题待解决。 总结:AI运营公司虽有潜力,但当前面对挑战。Fable 5等模子揭示必然上风,不外于繁杂贸易情况中,还有需存眷竞争及适配性问题,进一步摸索更有用的运用方式。内容由AI天生,仅供参考
AI当「老板」,快给10家公司干停业了……
普林斯顿年夜学近来弄了个CEO-Bench,让AI运营一家虚拟SaaS草创,为期500天。
谁曾经想,14位硅基CEO上场,只有4个保住了本金。
而这第四名,还有是个纯rule-based算法……
AI自立运营公司?让AI当老板??
至少此刻,还有是个年夜问号。
固然,也有一些能力凸起的模子,已经经揭示出潜力了——
Fable 5,500天到账4715万美元,全球最强「AI老板」。
人工智能CEO年夜赛
于正式最先不雅看本场「AI翻车」名排场前,先讲讲游戏法则。
启动状况:本金100万$,零客户。
游戏方针:于500天的模仿周期内,尽可能多赚钱。
评判尺度:游戏竣事时账上还有剩几多钱。假如半途余额跌破零,直接宣告停业,模仿终止。
还有蛮轻易理解的,跟玩豪富翁差未几,只不外交互方式纷歧样。
焦点是一个Python API,包罗34个东西、19张数据库表。Agent接入后,可以写代码、用SQL查询数据库,再按照查询成果动态调解事情流。

博弈情况中的变量也要多患上多。
订价计谋、告白投放渠道、研发预算分配、基础举措措施扩容、客服团队配置——全患上本身拿主张。
甚至还有有个模仿社交收集,AI可以于上面刷帖子、看客户投诉、视奸竞争敌手。
基本上能操控公司的一切,权限无穷年夜,及人类CEO如出一辙。

但这也象征着,没有人再从对于话框里敲下指令。模子必需独自为每个判定卖力。
这也是这场「饥饿游戏」最成心思之处——
告白投放后,客户可能下周才来;研发预算砸进去,产物质量晋升要等好几天……
成本立刻就能烧干。回报,会延迟好久。
这就是CEO最畏惧的「不确定性」,错一步就会触发连锁反映。
想用统计学线路鼎力大举出古迹?欠好意思,要害变量全数「隐式」存于。
客户满足度、付出意愿、最 低质量预期——这些指标,只能从退订率、工单数目、社交收集里反推。
与此同时,外部情况始终于动态变化:竞争敌手会出阴招,市场偏好随时间漂移,还有有宏不雅的经济周期……
可谓「地狱级」难度的长程决议计划使命。
上下文太爆炸了,不成能等所有信息去噪竣事再做决议,人类CEO更多时辰也是靠直觉。

事实证实,成果确凿惨烈。
14位参赛选手中,绝年夜大都裤衩子都快亏没了。
GLM 5.一、Claude Haiku 4.五、Gemini 3 Flash、DeepSeek V4 Pro、Grok 4.20,这五位更是中道崩殂,甚至都没完赛,「停业」遗憾离场。
跑出正收益AI,只有3个:
Claude Fable 5,4715万美元;
Claude Opus 4.8,2780万美元;
GPT-5.5,2130万美元。
冠军花落Fable 5——全球最会当「老板」的模子。
毫无牵挂的第 一位,给本金翻了整整47倍,断层领 先第二名Opus 4.8。
而且,Fable 5是唯 逐一个于不止一次运行中收益跨越初始资金的模子。
(btw,安全限定还有于发力,Fable 5屡次拒绝相应)
但这不是最出色之处。
实在有四位选手赚到了钱,只不外第四位不是LLM……
三位最 佳「本钱家」以外,排于第四名的参赛选手——
是个纯rule-based的开导式算法。
彻底没有挪用任何语言模子。固定订价、固定配额、固定层级……全是剧本设计好的法则。
你敢信,就是这么个「阿甘」,赚了1576万$。
跨越了除了Fable 五、Opus 4.8及GPT-5.5以外的所有模子。包括Qwen 3.7 Max、Opus 4.七、GLM 5.二、Kimi K2.6……

Takeaways
相称Drama了。
不外,比起角逐成果,这个历程中能提炼出的insight,也许更有价值。
这篇论文有两个焦点Takeaway——
一、摸索 审慎
算是一个比力切合直觉的发明。
从模子备忘录里能看到,GPT-5.5 及 Claude Opus 4.8 会跟着环境的变化不停测验考试新的计谋,不管是加年夜客户获取力度、调解层级,还有是调解撑持及研发预算。
比拟之下,Claude Opus 4.7于碰到挫折时重要采纳减少成本、保留现金的计谋。
这类守旧打法,虽然能让模子苟活到末了,却没法盈利。

俗语说:好死不如赖在世。
但贸易世界是「赢家通吃」——仅仅是在世,可能真没甚么意义。
想当一名乐成的CEO,「赌博」是必备技术(bushi)。
除了此以外,该论文还有提炼了四项要害能力维度:
发明隐蔽信息:好比哪一个告白渠道对于特定客户群最有用
猜测将来:以附近现金流猜测的偏差权衡
快速顺应变化:以模子察觉竞争敌手动作的速率权衡
提早计划:以Agent条记中if-then情景阐发的呈现频率权衡
于这四个维度上,Opus 4.8及GPT-5.5均高在其余模子的平均线。
二、编程Agent并不是万金油。
Harness是近来的热点话题,这项研究也触及了。
但结论,相称反共鸣。
研究员用Claude Code跑Opus 4.7,用Codex跑GPT-5.5。
成果,两位选手的步履次数显著削减,体现年夜幅降落……
颠末阐发,研究员指出缘故原由可能出于体系提醒词上。
编程Agent的体系提醒词是为软件开发场景优化的,硬套于CEO脚色上反而成为了束厄局促。
强加「马鞍」,还有不如裸骑。
前段时间SaaS股狂跌,全世界投资者高呼「软件末日」。编程Agent + MCP + Skill,好像能吃失一切。
但这项研究给出了纷歧样的判定:
Agent可能及年夜模子同样——差别行业,需要特定的Harness框架,需要垂直场景的深度适配。
而这,也许会于模子厂商纷纷下场侵蚀运用层确当下,创造出新的增量空间。
究竟,不成能每一个人城市用Codex,然后本身一步步搭建事情流。与Agent交互自己就有进修成本,统一套Harness也其实不能驭万马。
写作Agent、HR Agent、财政Agent……年夜部门用户仍旧需要极 致化的垂直产物。
画矩阵的人
1997年,苹果间隔停业只剩90天。
然后,乔布斯画了阿谁经典的2x2矩阵,指向两个标的目的——消费级及专业级、台式机及条记本。

随后年夜笔一挥,砍失了苹果70%的产物线,公布只为这四个格子造产物。
厥后的工作各人都知道了。iMac、iPod、iPhone。
这是乔老爷子回归苹果时的「神来之笔」:于极度不确定性下,彻底靠直觉,把无数可能性压缩进了一个极简框架。
回看科技史上的伟年夜迁移转变,往往都源在这类「纯粹的直觉」:
黄仁勋于AlexNet冷艳表态后,力排众议将英伟达的将来押注在深度进修;
Ilya Sutskever于曲线刚昂首时,便笃定地喊出「All in Scaling Law」;
Anthropic敏锐嗅到编程场景的潜力,于各人都于做多模态时选择了Coding,打OpenAI一个措手不和……
此刻的AI,能于每一个格子里,根据指定模板把颜色填满。
但画出阿谁矩阵的能力——
还有属在人类。
【本文由投资界互助伙伴微信公家号:量子位授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-304永利集团官网入口




