Local AI models will live and die by the quality of their data sets | 本地AI模型的成败取决于数据集的质量

在吉隆坡举行的东盟首次人工智能峰会期间,YTL AI Labs与马来亚大学合作推出了名为ILMU的大型语言模型(LLM)。该模型被誉为马来西亚首个完全自主、数据本地托管、管理和治理的AI模型,基于本地化数据训练,性能优于国际马来语基准模型。早在2024年12月,YTL已展示了该模型的早期版本,而最新版本则具备多模态能力,能处理文本、音频和图片,展现出在多语言、多文化环境中的潜力。

ILMU的训练数据包括本地美食和景点的图片,有助于教育和旅游等应用,特别是在马来西亚复杂的多元文化和多语言环境中。马来西亚的语言环境融合了马来语、英语、华语、泰米尔语等多种语言,ILMU的多模态能力有望更好地理解和应对这种多样性。这一发展是全球本地化语言模型的一部分,许多国家如印尼、印度、韩国、泰国、越南等都在开发本土化的AI模型,以弥补西方偏重英语的局限性。到今年底,拉丁美洲领导的Latam-GPT也将推出,支持该地区多种语言,包括土著方言,彰显区域多语种AI的发展趋势。

via SCMP Full Text Feed
 
 
Back to Top