就在今天凌晨,Anthropic 发布了最新的 Claude Opus 4.8。距离上一代 Opus 4.7 只过去一个多月,Claude 的更新节奏明显变快了。
按理说,4.8 更像是一次小版本迭代:能力微调,可靠性修补,安全策略继续加码。对于一个已经进入高频更新周期的大模型产品来说,这本该是一件并不意外的事。
但这次的舆论并没有停留在“升级了什么”上,而是先被另一个争议带偏了方向:不少用户通过 API 询问 Opus 4.8 自己是什么模型、背后公司是谁,得到的回答却并不稳定。它有时称自己是通义千问,有时又说来自深度求索。
这让外界很快联想到一个敏感问题:Anthropic 是否也在蒸馏中国模型?
过去一段时间,围绕中国模型是否蒸馏 Claude 的争议一直没有完全散去。如今相似的“身份错乱”出现在 Claude 自己身上,自然会被用户放大解读。
当然,模型是否真的存在蒸馏行为,需要证据链,而不能只靠几次问答截图下结论。但问题在于,Opus 4.8 在用户真正评测之前,已经先被套上了一层怀疑滤镜。
这对 Anthropic 来说并不是一个好开局。
更诚实,但也更保守
从官方表述看,Opus 4.8 的改动并不激进。最核心的关键词,是“更诚实”。
所谓更诚实,放到用户体验里,就是模型在不确定时更愿意承认不知道,不再轻易给出看似笃定、实则经不起验证的答案。过去大模型常见的那种先嘴硬、后道歉式幻觉,在 Opus 4.8 上理论上会减少。
这当然是重要改进。
尤其在 Agent 任务里,Anthropic 强调它更可靠,也更有判断力:能发现问题,提出异议,并在复杂任务中给出更稳妥的最终答案。
但问题也出在这里。
诚实和保守之间,并没有清晰边界。模型越倾向于规避风险,就越可能在一些用户真正需要判断的场景里变得模糊、犹豫、反复自我保护。
比如面对一张疑似毒蘑菇照片时,Opus 4.8 的表现确实谨慎。它会客观分析外观特征,也会提醒用户不能仅凭图片判断是否可食用。从安全角度看,这是负责任的,毕竟一旦有人照着 AI 的判断去吃,后果不是体验问题,而是现实风险。
但在更宽泛的使用场景里,这种谨慎会外溢。
哪怕模型已经认为风险很低,它也可能继续强调“仍有可能出错”“不能完全排除危险”“需要专家确认”。这些话都对,但当每一个问题都被包上一层安全免责声明,用户得到的就不再是答案,而是一段模型给自己叠甲的过程。
这正是 Claude 4.8 的第一个矛盾:它变得更可靠了,但也更不痛快了。
能力有提升,但不够惊艳
从性能表看,Opus 4.8 不是没有进步。
它在多个指标上都有小幅提升,尤其是复杂推理、Agent 任务和安全可靠性方面。但这种提升更像是工程层面的补齐,而不是一次能力曲线的跃迁。
更尴尬的是,在部分 coding 指标上,它并没有展现出压倒性优势,甚至有指标不如两个月前的 GPT-5.5。
这让 Opus 4.8 的定位有些微妙。
它不像一次代际升级,也不像一次价格足够友好的稳定迭代。它的能力确实强,但“强得是否足以让用户愿意为更高成本买单”,并没有被说服。
用户反馈也很分裂。
支持者认为,Opus 4.





