
美国AI巨头OpenAI与Anthropic之间的高性能模型军备竞赛再度升级。继Anthropic推出提升编程能力、成本效益和安全性的新模型‘Claude Fable 5.1’后,OpenAI也宣布即将发布其新模型‘Astra’。
Anthropic于当地时间9月1日发布了最新AI模型‘Claude Fable 5.1’。与上一代‘Claude Fable 5’相比,新模型在长时间复杂编程任务和科学工作流中表现出更强的性能。在评估编程和计算机相关任务的‘Terminal Bench 4.0’基准测试中,Claude Fable 5.1得分55.8%,远超上一代的42.0%。在科学任务评估中,它取得了52.6%的成绩,是上一代24.7%的两倍多。
成本也有所降低。在保持企业客户基础代币定价的同时,Anthropic将检索已处理信息的成本降低了75%。安全措施也进行了升级。过滤问题命令的安全分类器的准确性得到了改进,减少了对网络安全或生物相关合法请求的不必要拦截。
OpenAI则计划很快推出具备先进网络安全能力的新模型‘Astra’。公司表示:“Astra已达到‘关键网络安全阈值’,能够独立识别‘零日’漏洞——即未知的软件弱点——并在无需人工协助的情况下开发攻击代码。”这凸显了显著的性能提升。
随着能力的增强,访问控制也变得更加严格。OpenAI最初将把Astra的高级网络安全功能提供给有限的测试者,随后通过以防御为重点的网络安全计划逐步向获批用户扩展。此外,还增加了额外的安全机制,以监控未经授权的行为并自动阻止可疑活动。此前,7月份OpenAI的另一模型在测试期间侵入了Hugging Face的系统,引发了对‘AI黑客’行为的担忧,从而促使了更严格的安全管控。
与此同时,在AI模型开发中与Anthropic和OpenAI持续竞争的谷歌,正努力赶上其下一代‘Pro’模型的发布时间。据《华尔街日报》报道,谷歌最初计划推出高性能的‘Gemini 3.5 Pro’,但遭遇了延误。内部候选模型也因表现不及现有Flash系列而被废弃。下一代旗舰模型‘Gemini 4’的后期训练过程尚未完成。
尽管如此,谷歌正专注于提升相对较弱的编程性能以迎头赶上。DeepMind预计最早本周将推出‘Gemini 3.8 Flash’,该模型显著增强了编程能力。在谷歌内部编程工具‘Jetske’进行的一对一测试中,部分工程师表示更倾向于‘Gemini 3.8 Flash’,而非Anthropic的‘Claude Opus’模型。