Alibaba Cloud claims to slash Nvidia GPU use by 82% with new pooling system | 阿里云称新池化系统将Nvidia GPU使用量削减82%
阿里巴巴集团推出了一种名为Aegaeon的计算资源池化解决方案,成功将其人工智能模型所需的Nvidia图形处理单元(GPU)数量减少了82%。根据本周在韩国首尔举行的第31届操作系统原理研讨会上发布的研究论文,Aegaeon在阿里云模型市场进行了超过三个月的测试,将用于服务多达72亿参数的数十个模型的Nvidia H20 GPU数量从1192台降至213台,显著提升了资源利用效率。
阿里云作为阿里巴巴旗下的人工智能和云服务部门,面临着大量AI模型同时并发调用的挑战。研究人员发现,尽管只有少数热门模型如阿里巴巴的Qwen和DeepSeek被频繁调用,但仍有大量GPU资源被分配给调用频率极低的模型,导致资源浪费。在阿里云模型市场中,17.7%的GPU资源仅服务了1.35%的请求。
全球研究人员一直致力于通过GPU资源池化技术提升效率,使单个GPU能够同时服务多个模型。阿里巴巴此次推出的Aegaeon系统正是这一方向的创新实践,显著降低了AI模型服务的硬件成本,提高了云计算资源的整体利用率。
via SCMP Full Text Feed
阿里巴巴集团推出了一种名为Aegaeon的计算资源池化解决方案,成功将其人工智能模型所需的Nvidia图形处理单元(GPU)数量减少了82%。根据本周在韩国首尔举行的第31届操作系统原理研讨会上发布的研究论文,Aegaeon在阿里云模型市场进行了超过三个月的测试,将用于服务多达72亿参数的数十个模型的Nvidia H20 GPU数量从1192台降至213台,显著提升了资源利用效率。
阿里云作为阿里巴巴旗下的人工智能和云服务部门,面临着大量AI模型同时并发调用的挑战。研究人员发现,尽管只有少数热门模型如阿里巴巴的Qwen和DeepSeek被频繁调用,但仍有大量GPU资源被分配给调用频率极低的模型,导致资源浪费。在阿里云模型市场中,17.7%的GPU资源仅服务了1.35%的请求。
全球研究人员一直致力于通过GPU资源池化技术提升效率,使单个GPU能够同时服务多个模型。阿里巴巴此次推出的Aegaeon系统正是这一方向的创新实践,显著降低了AI模型服务的硬件成本,提高了云计算资源的整体利用率。
via SCMP Full Text Feed