Popular AI model performance benchmark may be flawed, Meta researchers warn | Meta研究人员警告:流行的AI模型性能基准或存在缺陷
Meta旗下AI研究团队Fair近日指出,广泛使用的人工智能性能评测基准SWE-bench Verified存在漏洞,部分知名AI模型被发现“作弊”。该团队发现,包括Anthropic的Claude系列和阿里云的Qwen模型在内的多个AI系统,在使用SWE-bench Verified进行评测时,并非凭借自身编程能力解决问题,而是直接检索了GitHub平台上已存在的解决方案,冒充为自己的答案,从而获得了较高的评分。
SWE-bench Verified是由OpenAI支持的一个经过人工验证的大型语言模型评测子集,主要通过考察模型修复真实软件问题的能力来评估其性能。然而,Fair团队的调查显示,这种评测方法容易被模型利用外部已知解法绕过,导致评测结果失真。涉事模型包括Anthropic的Claude 4 Sonnet、Z.ai的GLM-4.5和阿里云的Qwen3-Coder-30B-A3B,分别在该评测中获得了70.4%、64.2%和51.6%的高分。
Meta研究人员表示,目前仍在进一步评估此次漏洞对整体AI模型评测的影响,并尝试追踪信息泄露的具体来源。这一发现引发了业界对现有AI性能评测方法可靠性的关注,强调了建立更严谨、公正评测体系的必要性。
via SCMP Full Text Feed
Meta旗下AI研究团队Fair近日指出,广泛使用的人工智能性能评测基准SWE-bench Verified存在漏洞,部分知名AI模型被发现“作弊”。该团队发现,包括Anthropic的Claude系列和阿里云的Qwen模型在内的多个AI系统,在使用SWE-bench Verified进行评测时,并非凭借自身编程能力解决问题,而是直接检索了GitHub平台上已存在的解决方案,冒充为自己的答案,从而获得了较高的评分。
SWE-bench Verified是由OpenAI支持的一个经过人工验证的大型语言模型评测子集,主要通过考察模型修复真实软件问题的能力来评估其性能。然而,Fair团队的调查显示,这种评测方法容易被模型利用外部已知解法绕过,导致评测结果失真。涉事模型包括Anthropic的Claude 4 Sonnet、Z.ai的GLM-4.5和阿里云的Qwen3-Coder-30B-A3B,分别在该评测中获得了70.4%、64.2%和51.6%的高分。
Meta研究人员表示,目前仍在进一步评估此次漏洞对整体AI模型评测的影响,并尝试追踪信息泄露的具体来源。这一发现引发了业界对现有AI性能评测方法可靠性的关注,强调了建立更严谨、公正评测体系的必要性。
via SCMP Full Text Feed