大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础
背景
接上文 《大语言模型的基石:Transformer 入坑笔记(三) - 注意力机制和 Transformer》。
通过之前的内容,我们大致了解了大语言模型的基石:Transformer 的基础原理。 但随之而来有一个问题:随着参数量和上下文长度的增长,计算量太大扛不住了。
现在很多大语言模型,经过了多轮迭代,终于陆陆续续能在参数量持续提高的前提下同时支撑 1M 上下文。
接上文 《大语言模型的基石:Transformer 入坑笔记(三) - 注意力机制和 Transformer》。
通过之前的内容,我们大致了解了大语言模型的基石:Transformer 的基础原理。 但随之而来有一个问题:随着参数量和上下文长度的增长,计算量太大扛不住了。
现在很多大语言模型,经过了多轮迭代,终于陆陆续续能在参数量持续提高的前提下同时支撑 1M 上下文。