DeepSeek unveils new AI reasoning method as anticipation for its next-gen model rises | 深势科技发布全新AI推理方法,下一代模型引人期待

中国人工智能初创公司DeepSeek推出了一种新方法,旨在提升大型语言模型(LLM)的推理能力,同时公众也在期待该公司下一代模型的发布。DeepSeek与清华大学的研究人员合作,开发了一种名为生成奖励建模(GRM)和自原则批评调整相结合的技术。这种双重方法旨在使LLM能够更快、更好地响应一般查询。

研究人员表示,由此产生的DeepSeek-GRM模型优于现有方法,在强大的公共奖励模型中“取得了具有竞争力的性能”。奖励建模是一种引导LLM满足人类偏好的过程。DeepSeek计划开源GRM模型,但没有给出具体时间表。此前,DeepSeek的V3基础模型和R1推理模型受到全球关注,引发了人们对其下一步行动的猜测。据报道,DeepSeek-R2可能会在本月发布,但该公司对此保持沉默,未通过官方渠道发表评论。

via SCMP Full Text Feed
 
 
Back to Top