
大模型读一本小说或者长篇财报时,经常越到后面越慢,甚至直接“卡死”。究其原因,是系统在处理超长文本时,内存和计算资源像雪球一样越滚越大。今天,小红书开源了他们的RedKnot推理引擎,专门破解这个难题——实测下,模型处理128K超长文本的速度提升了5倍多,而计算资源的消耗却砍掉了近八成。
传统大模型在推理时,会缓存每个词元(token)的键值数据(KV Cache),文本越长,缓存越多,内存和计算量就直线上升。RedKnot换了个思路:它不再按词元来存缓存,而是改成按“注意力头”(Attention Head)来拆解。同时,它引入了三个新机制——头分类稀疏、稀疏FFN、SegPagedAttention——让算法逻辑和存储粒度更匹配,就像把杂乱的文件按日期和类型分文件夹整理,找起来快得多。
效果立竿见影。在8卡H800这样的高性能计算环境下,RedKnot能让模型的首字生成时间(TTFT)提升1.6到3.54倍,单卡能同时处理的请求数量提升了4.7到7.8倍。在预填充阶段(模型先“预习”一遍文本),计算资源消耗减少了67%到79.5%。举例来说,在128K上下文的超长任务中,用DeepSeek-V4-Flash模型跑,首字生成速度提升了5.16倍,KV数据的传输效率优化了6.3倍,而且推理精度依然保持在稠密模型性能的95%以上。
在AI算力越来越贵的今天,这种从底层架构入手“抠细节”的做法,给整个行业提供了一条新路径:不用堆更多显卡,也能让大模型流畅处理长文本。目前RedKnot的代码已经开源,对开发者来说,这意味着长文本AI应用的门槛又降了一大截。下一步,或许我们就能用上更智能、更省钱的文档分析、长对话和长视频理解工具了。