526互联
首页
Ai
Java
Python
Android
Mysql
JavaScript
Html
CSS
BigBird
深入理解 BigBird 的块稀疏注意力
引言 基于 transformer 的模型已被证明对很多 NLP 任务都非常有用。然而,\(O(n^2)\) 的时间和内存复杂度 (其中 \(n\) 是序列长度) 使得在长序列 (\(n > 512\)) 上应用它们变得非常昂贵,因而大大限制了其应用。最近的几篇论文,如 Longformer 、Pe ......
注意力
BigBird
更新时间 2023-11-24
共1篇 :1/1页
首页
上一页
1
下一页
尾页