<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>线性注意力 on I'm OWenT</title><link>//owent.net/tags/%E7%BA%BF%E6%80%A7%E6%B3%A8%E6%84%8F%E5%8A%9B.html</link><description>Recent content in 线性注意力 on I'm OWenT</description><generator>Hugo</generator><language>zh-cn</language><copyright>&lt;a rel="license" href="https://github.com/owent/blog-hugo/blob/master/LICENSE.md"&gt;&lt;img alt="知识共享许可协议" style="border-width:0" src="https://i.creativecommons.org/l/by-nc-sa/4.0/80x15.png" /&gt;&lt;/a&gt;</copyright><lastBuildDate>Sun, 06 Sep 2026 22:47:45 +0000</lastBuildDate><atom:link href="//owent.net/tags/%E7%BA%BF%E6%80%A7%E6%B3%A8%E6%84%8F%E5%8A%9B/index.xml" rel="self" type="application/rss+xml"/><item><title>大语言模型的基石：Transformer 入坑笔记（四） - 线性注意力(Linear Attention) 的基础</title><link>//owent.net/2026/2611.html</link><pubDate>Sun, 06 Sep 2026 22:47:45 +0000</pubDate><guid>//owent.net/2026/2611.html</guid><description>&lt;h2 id="背景"&gt;背景&lt;/h2&gt;&#10;&lt;p&gt;接上文 &lt;a href="https://owent.net/2026/2610.html"&gt;《大语言模型的基石：Transformer 入坑笔记（三） - 注意力机制和 Transformer》&lt;/a&gt;。&lt;/p&gt;&#10;&lt;p&gt;通过之前的内容，我们大致了解了大语言模型的基石：&lt;a href="https://github.com/huggingface/transformers"&gt;Transformer&lt;/a&gt; 的基础原理。&#10;但随之而来有一个问题：随着参数量和上下文长度的增长，计算量太大扛不住了。&lt;/p&gt;&#10;&lt;p&gt;现在很多大语言模型，经过了多轮迭代，终于陆陆续续能在参数量持续提高的前提下同时支撑 1M 上下文。&lt;/p&gt;</description></item></channel></rss>