Alibaba challenges OpenAI and Google with new multimodal AI model | 阿里巴巴推出新多模态AI模型,挑战OpenAI和谷歌
阿里巴巴集团在周二发布了一系列新的人工智能模型,其中包括一款与OpenAI的GPT-4以及谷歌“Nano Banana”图像编辑器相竞争的多模态系统。其中最引人注目的是Qwen3-Omni,这是一款旗舰级的多模态模型,能处理文本、音频、图像和视频输入,并以文本和音频形式作出回应。该模型被认为是首个将文本、图像、音频和视频融合在一个端到端系统中的多模态模型,显示出阿里巴巴在该领域的技术创新。
据开发团队介绍,Qwen3-Omni的两个变体在音频识别、理解以及图像和视频理解方面的基准测试中,表现优于前一版本Qwen2.5-Omni-7B,以及国际竞争对手如GPT-4和Google的Gemini 2.5-Flash(“Nano Banana”)。阿里巴巴云团队的研究员林俊扬表示,这些改进得益于公司在音频和图像基础项目上的持续投入,彰显了其在人工智能多模态技术上的竞争实力。
via SCMP Full Text Feed
阿里巴巴集团在周二发布了一系列新的人工智能模型,其中包括一款与OpenAI的GPT-4以及谷歌“Nano Banana”图像编辑器相竞争的多模态系统。其中最引人注目的是Qwen3-Omni,这是一款旗舰级的多模态模型,能处理文本、音频、图像和视频输入,并以文本和音频形式作出回应。该模型被认为是首个将文本、图像、音频和视频融合在一个端到端系统中的多模态模型,显示出阿里巴巴在该领域的技术创新。
据开发团队介绍,Qwen3-Omni的两个变体在音频识别、理解以及图像和视频理解方面的基准测试中,表现优于前一版本Qwen2.5-Omni-7B,以及国际竞争对手如GPT-4和Google的Gemini 2.5-Flash(“Nano Banana”)。阿里巴巴云团队的研究员林俊扬表示,这些改进得益于公司在音频和图像基础项目上的持续投入,彰显了其在人工智能多模态技术上的竞争实力。
via SCMP Full Text Feed