DeepSeek sheds light on data collection for AI training | DeepSeek揭示AI训练中的数据收集内幕
中国人工智能公司DeepSeek披露其模型训练的数据筛选流程,强调其在数据收集和过滤方面采取了严格措施,以减少“幻觉”和“滥用”的风险。该公司表示,其在预训练阶段主要从公开的网络信息和授权的第三方数据中收集数据,并无意收集个人隐私。公司采用自动筛选器去除包含仇恨言论、色情、暴力、垃圾信息等内容,同时结合算法检测和人工审核,识别数据中的统计偏差,以减轻对模型价值的影响。
DeepSeek由计算机科学家梁文锋创立,致力于通过检索增强生成等技术减少模型的“幻觉”问题,但公司也承认这是一个“无法避免”的难题。公司提醒用户在必要时寻求专业建议,并强调其模型主要基于提示预测答案而非检索信息。随着AI技术的不断发展,业界对AI生成错误信息、误导结果甚至潜在心理影响的担忧也在增加,特别是在行业监管日益加强的背景下。
via SCMP Full Text Feed
中国人工智能公司DeepSeek披露其模型训练的数据筛选流程,强调其在数据收集和过滤方面采取了严格措施,以减少“幻觉”和“滥用”的风险。该公司表示,其在预训练阶段主要从公开的网络信息和授权的第三方数据中收集数据,并无意收集个人隐私。公司采用自动筛选器去除包含仇恨言论、色情、暴力、垃圾信息等内容,同时结合算法检测和人工审核,识别数据中的统计偏差,以减轻对模型价值的影响。
DeepSeek由计算机科学家梁文锋创立,致力于通过检索增强生成等技术减少模型的“幻觉”问题,但公司也承认这是一个“无法避免”的难题。公司提醒用户在必要时寻求专业建议,并强调其模型主要基于提示预测答案而非检索信息。随着AI技术的不断发展,业界对AI生成错误信息、误导结果甚至潜在心理影响的担忧也在增加,特别是在行业监管日益加强的背景下。
via SCMP Full Text Feed