#transformer

共 3 篇文章

大模型与架构 2026/6/1

大语言模型是怎么工作的?

大语言模型工作原理深度解析:从Transformer架构到预训练、微调、推理的完整技术链路。

llm transformer
阅读更多
大模型与架构 2026/6/26

Transformer 架构详解:从 Attention 机制到行业范式

本文全面解析Transformer:首个完全基于注意力机制的序列转换模型。文章先对比RNN/CNN的不足,再介绍编码器-解码器架构、多头自注意力、Scaled Dot-Product Attention、位置编码与训练细节,最后给出WMT机器翻译实验结果,说明其训练效率与翻译质量优势。

transformer attention-mechanism
阅读更多
大模型与架构 2026/7/12

Mamba 状态空间模型原理与 Transformer 对比

本文解读 Mamba 选择性状态空间模型,针对 Transformer 自注意力二次复杂度与固定上下文窗口的瓶颈,提出让 SSM 参数随输入动态变化的选择机制,并设计硬件感知并行 scan 算法,在保持线性序列复杂度的同时达到 Transformer 级别的建模能力。

mamba state-space-model
阅读更多