大模型与架构 2026/6/26
Transformer 架构详解:从 Attention 机制到行业范式
本文全面解析Transformer:首个完全基于注意力机制的序列转换模型。文章先对比RNN/CNN的不足,再介绍编码器-解码器架构、多头自注意力、Scaled Dot-Product Attention、位置编码与训练细节,最后给出WMT机器翻译实验结果,说明其训练效率与翻译质量优势。
transformer attention-mechanism
阅读更多
大模型与架构 2026/7/12
Mamba 状态空间模型原理与 Transformer 对比
本文解读 Mamba 选择性状态空间模型,针对 Transformer 自注意力二次复杂度与固定上下文窗口的瓶颈,提出让 SSM 参数随输入动态变化的选择机制,并设计硬件感知并行 scan 算法,在保持线性序列复杂度的同时达到 Transformer 级别的建模能力。
mamba state-space-model
阅读更多