Alibaba launches AI model that can process images and video on phones and laptops | 阿里巴巴推出AI模型,可在手机和笔记本电脑上处理图像和视频
```html
阿里巴巴集团推出了名为Qwen2.5-Omni-7B的全新多模态人工智能(AI)模型,该模型能够在智能手机和笔记本电脑上处理文本、图像、音频和视频。这款拥有70亿参数的模型旨在让日常用户更容易地使用先进的AI功能,因为它可以在移动设备上运行。阿里巴巴表示,该模型可以处理各种类型的输入,并以文本或音频形式生成实时响应,目前已在Hugging Face、微软的GitHub和阿里巴巴的ModelScope上开源。
Qwen2.5-Omni-7B模型展示了强大的性能,在OmniBench测试中得分56.1,超过了谷歌Gemini-1.5-Pro的42.9。在CV15音频基准测试中,它也优于阿里巴巴之前的Qwen2-Audio模型,得分92.4。在图像相关任务中,它在Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark上获得了59.2分,超过了Qwen2.5-VL视觉语言模型。阿里巴巴强调了该模型的潜在用途,例如为视障用户提供实时音频描述,以及通过分析食材提供逐步烹饪指导。
```
via SCMP Full Text Feed
```html
阿里巴巴集团推出了名为Qwen2.5-Omni-7B的全新多模态人工智能(AI)模型,该模型能够在智能手机和笔记本电脑上处理文本、图像、音频和视频。这款拥有70亿参数的模型旨在让日常用户更容易地使用先进的AI功能,因为它可以在移动设备上运行。阿里巴巴表示,该模型可以处理各种类型的输入,并以文本或音频形式生成实时响应,目前已在Hugging Face、微软的GitHub和阿里巴巴的ModelScope上开源。
Qwen2.5-Omni-7B模型展示了强大的性能,在OmniBench测试中得分56.1,超过了谷歌Gemini-1.5-Pro的42.9。在CV15音频基准测试中,它也优于阿里巴巴之前的Qwen2-Audio模型,得分92.4。在图像相关任务中,它在Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark上获得了59.2分,超过了Qwen2.5-VL视觉语言模型。阿里巴巴强调了该模型的潜在用途,例如为视障用户提供实时音频描述,以及通过分析食材提供逐步烹饪指导。
```
via SCMP Full Text Feed