On-Demand Attention:大模型终于学会“挑着看”了
AI工具
摘要
On-Demand Attention 提出一种新方法,使大模型在推理时能够选择性关注上下文。该方法无需重新训练或删除缓存,仅增加一个参数占比低于0.1%的决策模块,即可在128K上下文下减少58%至73%的KV读取,解码速度提升1.8至2.4倍,同时保持98%以上的精度。
大模型终于学会“挑着看”了!On-Demand Attention 不重训、不删缓存,只加一个<0.1%参数的决策小脑,就能在128K上下文下减少58%–73%的KV读取,解码提速1.8–2.4倍,精度仍保持98%以上。
转载信息
原文:
On-Demand Attention:大模型终于学会“挑着看”了
(2026-09-26 15:20)
作者:
yweng18
分类:
技术
0
0
111
评论 (0)
请 登录 后发表评论
暂无评论,来留下第一条评论吧