研究人员发现,DeepSeek模型其表现的怪异特性,源于输入信息的位置变化。具体来说,字节公司Seed团队通过实验观察到,DeepSeek-V4当面临同一道题时,答案会因为前置的几个无关字符而产生显著变化,甚至在某些情况下,错误答案的准确率和正确答案的准确率差距达到40.2个百分点。这一现象令人困惑,表明模型的判断似乎依赖于信息在输入中的位置。

about image

在进行128K长上下文检索测试时,研究人员发现偏偏是KV Cache压缩技术的使用导致了这一问题。该技术本是为了优化处理长文本的效率和内存使用,但意外地使得DeepSeek模型的表现不再稳定。具体实验中,团队用DeepSeek-V4-Flash-Base为样本,在补全最后一个Token的任务中,模型有时会输出错误的32,而非应有的8。通过在代码前部添加重复的装饰性字符串,研究人员可以观察到随着无关Token数量的变化,模型的准确性也在不断波动,揭示了答案的不一致性。

about image

更深入的研究显示,在128K Token的长上下文里,尽管任务的内容和上下文保持一致,模型的表现仍然会受到目标信息相对压缩窗口边界位置的影响。这种影响体现在DeepSeek-V4-Flash-Base模型中,准确率曲线明显呈现周期性起伏,差距最高达到40.2个百分点。即便在后续训练后,虽然差距有所减小,但周期性波动的现象依然存在。

研究人员将关注点转向KV Cache压缩的影响,发现模型在处理历史Token的Key和Value信息时,由于上下文长度的增加,KV Cache在内存与计算效率方面成为瓶颈。因此,DeepSeek-V4引入了分块KV Cache压缩,旨在通过将数据分窗口压缩为更少的缓存项来平衡效率和性能。然而,实验结果表明,这一技术在具体应用中也带来了意想不到的周期性问题,令人不得不重新审视大模型的设计与优化策略。

about image