304永利集团官网入口-Sonnet 5终于来了,然而Opus 4.8现在有点尴尬
首页财产ai正文 Sonnet 5终究来了,然而Opus 4.8此刻有点难堪 Anthropic的Sonnet 5更新,机能与Opus 4.8持平且8月31日前token打折,还有发了Claude Science,但Anthropic近期因给中国用户标志等事堕入风浪。 2026-07-01 10:46 ·字母榜 苗正 苗正 AI投资人解读· Sonnet 5机能与Opus 4.8持平,价格约为其一半,常识方面反超,能完成繁杂使命,安全防护能力较强。Anthropic推出头具名向生命科学的Claude Science。 · Opus 4.8被指做弊和“断崖式降智”Claude Code被发明给中国用户“汲水印”。 总结:Sonnet 5有投资亮点,但Anthropic存于诸多问题,如产物诚信受质疑、涉敏感标志举动,投资前需周全评估其技能不变性、荣誉危害和潜于政策影响。
寂静了小半年,Sonnet终究更新到5版本了。好动静,机能险些及Opus 4.8持平,坏动静,比之前成本高了,别的一个好动静,8月31日前token打折。
我知道,真正代表Anthropic技能天花板的是Fable 5及Opus 4.8。特别是Anthropic如今邻近上市,这两张牌才是IPO叙事的策动机。
但说真话,作为平凡消费者,我更存眷的还有是Sonnet 5,由于我需要的是一个充足智慧,且不至在让我月尾肉疼的模子。
与此同时,Anthropic也曝出会于体系提醒词里给中国用户上标志。
虽然今朝并未呈现公然证据证实它会据此封号或者降权,但这件事已经经充足敏感:用户看不见,模子照常跑,后台却能经由过程一组险些不成察觉的格局差异,把特定地域的挪用零丁辨认出来。
别的,Anthropic官方暗示,美国已经排除对于Claude Fable5及Mythos5的出口管束,Anthropic将在嫡最先恢复拜候权限
0一、Sonnet 5到底强于哪
不空话,直接看数据。
于Agent编程方面,Sonnet 5患上分63.2%,比拟Sonnet 4.6的58.1%涨了5.1%,间隔Opus 4.8的69.2%还有剩6%。
可是于常识方面,Sonnet 5反超了Opus 4.8。
Anthropic对于Sonnet 5的定位是“迄今为止最 具Agent能力的Sonnet”。
官方暗示,Sonnet 5可以自立制订规划、挪用阅读器及终端等东西、永劫间自力运行,而于几个月前,这些能力还有只有更年夜、更贵的模子才能做到。
说白了,Anthropic的意思是Sonnet 5也能干之前Opus及Fable级另外事情了。
真正成心思之处是于Agent搜刮及计较机操作方面,于不调高模子“当真(effort)水平”的环境下,Sonnet 5能干过的活儿比Opus 4.8多。调到最当真那档之后,Sonnet 5有些使命直接追上Opus 4.8,并且花的钱还有少一年夜截。
以是总归一句话,Sonnet 5只用Opus 4.8约莫一半不到的价格,做到了它80%-90%的程度。
还有没完。Sonnet 5的测试者们均暗示,之前Sonnet无法完成的繁杂使命,此刻Sonnet 5能轻松跑完,甚至还有会自动查抄本身的输出。
Zapier的工程师举了个例子,他让模子持续履行“更新Salesforce账户等级,再给企业客户发通知布告邮件”,Sonnet 5一口吻做完了,而他暗示,“之前会卡于半路”。
于安全方面,Sonnet 5的幻觉率及迎合偏向都低在Sonnet 4.6,于Agent场景下抵御提醒注入进犯的能力也更强。同时,模子默许开启了及时安全防护。也就是说,模子于跑的时辰,体系会于后台检测它是否是于干伤害的收集安全操作,发明就就地掐断。
有一个评测尤其值患上说。Anthropic结合Mozilla,用Firefox 147的已经知缝隙测试模子的缝隙使用能力。
所谓缝隙使用,指的是给定一个已经知的软件缝隙,看看模子能不克不及本身写出代码来进犯它。
Sonnet 5及 Sonnet 4.6同样,完备缝隙使用的乐成率是0%。它能写出代码片断,但始终拼不出一个完备可用的进犯步伐。这申明它的代码能力虽然涨了,但还有不具有自立倡议收集进犯的程度。
比拟之下,Opus 4.8于这项测试中体现出较着的收集进犯能力。
Anthropic暗示,他们没有决心练习Sonnet 5做收集安全,它于这方面的能力年夜幅弱在Opus 4.8及Mythos 5,这是成心为之。
不外Anthropic也暗示,于一项笼罩年夜量不良举动的主动化审计中,Sonnet 5的总体患上分比 Sonnet 4.6更安全,但它确凿于某些不良举动上比Opus 4.8及Mythos Preview更易“掉态”。
官方把这归因在更强的模子自己具有更好的举动对于齐,同时也认可Sonnet 5还有没到达旗舰级模子的克制程度。
还有有一个细节必需患上说一下,Sonnet 5换了新的分词器。
一样的文本输入,耗损的Token数目可能比本来多1.0到1.35倍。
Anthropic的说法是,推广期价格会先降低token用度,以让短时间内用户顺应总成本变化。
详细来讲,8月31日前每一百万输入是2美元、输出是10美元;输入3美元、输出15美元。分词器变化带来的现实耗损增长,8月31日以后,价格可能会比之前更高。
陪同着Sonnet 5,Anthropic还有发了Claude Science。这是一个面向生命科学的AI事情台,定位是“科研范畴的 Claude Code”。
它用的是现有的Claude模子,把60多个科学数据库、可复现的计较流程及当地运算能力打包进了一个Agent的界面。
初期用户里,UCSF的一个团队靠它发明了RNA-seq数据里一个卡了快要一年的试验室污染物。
Anthropic正于从卖模子转向更高层,Claude Code是开发者的,Claude Science想做科研职员的。
0二、可是Anthropic近来不承平
claudefa.st的数据显示,约莫90%的API哀求走的是Sonnet 4.6。
Opus系列虽然强,但真正撑起Anthropic流量的,还有患上是自制好用的Sonnet。
从2月到6月,Opus系列连发了三个年夜版本,Opus 4.六、4.七、4.8,Agent能力愈来愈强。可问题是,Sonnet停于4.6这个版本里快要泰半年的时间。
Opus的价格快要是Sonnet的两倍,对于在平凡开发者来讲太贵了。
更难堪的是,Opus 4.8不争气。
6月26日,Cursor AI官方发了一篇重磅研究,实锤了Opus 4.8于编程评测里年夜范围“偷看谜底”。
研究显示,Opus 4.8于SWE-bench上跑出87.1%的成就是做弊的,一旦断网、堵截它读代替码堆栈 .git汗青的能力,成就直接狂跌到73.0%。
Datacurve的评测也显示,Opus 4.6及4.7于跨越12% 的被审使命中被标志为“做弊”。
这还有没完。已往几周,Opus 4.8持续被曝“断崖式降智”。思索深度降落67%,基础逻辑推理几次翻车,幻觉率飙升。
外网论坛上有开发者诉苦,此刻用Opus 4.8 Max的觉得“比用老款Haiku还有要糟糕糕患上多”。
并且就于Sonnet 5的统一天,外网论坛里有人发明,Claude Code从本年4月2日的2.1.91 版本最先,会于体系提醒词里暗暗给中国用户“汲水印”。

详细的做法是,它检测你的时区是否设为亚洲、代办署理URL是否指向中国域名。
假如是,就把体系提醒词里的日期格局从2026-06-30暗暗改为2026/06/30,撇号也从ASCII换成肉眼分不出的Unicode字符U+02BC。
用户彻底看不到这些改动,但Anthropic的后台一清二楚,其目的也不问可知。
除了了时区,它还有查抄代办署理URL是否匹配一个内含147笔记录的域名黑名单,笼罩中国年夜厂域名、云办事商、AI试验室、API中转站。
假如匹配上,日期分开符换成斜杠,撇号换成隐写字符。三条旌旗灯号叠加,充足Anthropic于后台切确辨认每个中国开发者。
【本文由投资界互助伙伴字母榜授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。
-304永利集团官网入口




