DeepSeek’s updated R1 AI model matches Google, Anthropic in coding benchmark | DeepSeek更新版R1 AI模型在编程基准测试中媲美谷歌与Anthropic

中国人工智能初创公司DeepSeek最新更新的模型DeepSeek-R1,在实时AI编程竞赛WebDev Arena中表现出色,与谷歌的Gemini-2.5和Anthropic的Claude Opus 4并列第一,显示出其在编码任务上的高效和准确性。该模型得分为1408.84,紧随Opus 4的1405.51和Gemini-2.5的1433.16。WebDev Arena通过人类评审对模型输出质量进行评分,DeepSeek-R1自今年1月发布以来,在多项基准测试中表现稳定且训练成本显著低于竞争对手。

DeepSeek于5月底悄然发布了R1的首次升级版本R1-0528,虽然称为“小幅升级”,但提升了推理和创作能力,并将“幻觉”现象(生成误导性信息)减少了50%。此次更新引起开发者社区关注,大家也期待DeepSeek下一代推理模型R2的发布,尽管公司尚未透露具体时间。

DeepSeek采取开放源码策略,使其高性能模型能够被开发者自由使用和修改,这一做法促进了其在业内的快速普及,并影响了中国科技巨头如百度等企业对开源模型的认可和支持,彰显了其在AI领域的独特竞争优势。

via SCMP Full Text Feed
 
 
Back to Top