DeepSeek unveiled AI model that uses visual perception to compress text input | DeepSeek推出利用视觉感知压缩文本输入的AI模型

杭州人工智能初创公司DeepSeek发布了一款新的多模态人工智能模型DeepSeek-OCR,该模型通过视觉感知技术对信息进行压缩,能够以显著减少的文本单位(token)处理大型复杂文档,从而降低计算成本。该模型是对视觉编码器在大语言模型(LLMs)中压缩文本作用的深入研究成果,能够实现7到20倍的token减少,有效解决了长文本处理中的难题。

DeepSeek-OCR作为开源项目,已在Hugging Face和GitHub等开发者平台上线,包含两个主要部分:DeepEncoder编码器和DeepSeek3B-MoE-A570M解码器。该技术展示了DeepSeek持续提升AI模型效率、降低开发及使用成本的努力,延续了其此前发布的开源模型V3和R1的创新精神。

via SCMP Full Text Feed
 
 
Back to Top