(来源:新智元)

新智元报道

Claude一夜变笨,全网吵翻了!
就在昨天,开发者argofowl花了整整一个下午,差点把Claude Code翻了个底朝天。

他一路排查,先是怀疑是t3 code崩了,接着又以为自己的代码出现了bug。
查到最后,他甚至开始怀疑——难道是自己把Mac搞坏了?
当argofowl最终打开API的真实请求日志时,一切真相大白,里面赫然写着一个数字「10」。

然而,在Claude Code后台,他明明选的是「high」,最高档推理程度。
谁曾想,Claude Code的更新日志,一个字都没写。
推理high变成10
Claude Code变笨曝光
argofowl发现,从Claude Code 2.1.237开始,模型把「high」推理程度读成了10 out of 100。
而这个数字,正是过去「low」档对应的值。
细扒发现,Anthropic把Claude Code 2.1.236及以上版本的Fable 5会话,纳入了一个「压缩effort数值刻度」的实验。
不过,老版本和Opus 5不受影响。

这大概率是个A/B测试,所以不是人人都会撞上。
对开发者来说,这才是真正的痛点。模型强一点弱一点,还能忍。
但你把我拉进了实验组,却不打算告诉我:那我这一下午到底在debug什么?是在调自己的代码,还是在调你的A/B测试?
没想到,科技博主Chubby转发之后,AI圈直接炸了——
看起来,Anthropic把模型悄悄调笨了,却没告诉任何人。

一时间,X上「Claude变笨了吗」的自测帖子刷屏。
有人贴出同一段prompt在不同版本下的输出对比,有人翻出自己两周前的会话记录做逐行diff。
Anthropic认错,工程师下场
面对这场风暴,Claude Code工程师Thariq Shihipar的回应来得很快。
我们有时候会在Claude Code里先测试API的服务配置,再决定要不要全量推。
现在跑的这个实验,只是把effort的数值映射方式改了。所以有些人会看到Claude说自己是「10」。

关键是,这个刻度不是0到100,那个数字单独看没有任何意义,你选
红包分享
钱包管理

