On-Demand Attention:大模型终于学会“挑着看”了

AI工具
On-Demand Attention:大模型终于学会“挑着看”了
摘要

On-Demand Attention 提出一种新方法,使大模型在推理时能够选择性关注上下文。该方法无需重新训练或删除缓存,仅增加一个参数占比低于0.1%的决策模块,即可在128K上下文下减少58%至73%的KV读取,解码速度提升1.8至2.4倍,同时保持98%以上的精度。

大模型终于学会“挑着看”了!On-Demand Attention 不重训、不删缓存,只加一个<0.1%参数的决策小脑,就能在128K上下文下减少58%–73%的KV读取,解码提速1.8–2.4倍,精度仍保持98%以上。

转载信息
原文: On-Demand Attention:大模型终于学会“挑着看”了 (2026-09-26 15:20)
作者: yweng18 分类: 技术
链接: https://blog.csdn.net/yweng18/article/details/166689933 |声明:转载仅供分享;侵权联系删除。
评论 (0)
请 登录 后发表评论

暂无评论,来留下第一条评论吧