大模型与架构

共 7 篇文章

模型架构

3 篇
模型架构 2026/6/26

Transformer 架构详解:从 Attention 机制到行业范式

本文全面解析Transformer:首个完全基于注意力机制的序列转换模型。文章先对比RNN/CNN的不足,再介绍编码器-解码器架构、多头自注意力、Scaled Dot-Product Attention、位置编码与训练细节,最后给出WMT机器翻译实验结果,说明其训练效率与翻译质量优势。

transformer attention-mechanism
阅读更多
模型架构 2026/7/12

Mamba 状态空间模型原理与 Transformer 对比

本文解读 Mamba 选择性状态空间模型,针对 Transformer 自注意力二次复杂度与固定上下文窗口的瓶颈,提出让 SSM 参数随输入动态变化的选择机制,并设计硬件感知并行 scan 算法,在保持线性序列复杂度的同时达到 Transformer 级别的建模能力。

mamba state-space-model
阅读更多

协议与生态

1 篇
协议与生态 2026/7/12

MCP 生态与官方 Servers 实战

本文面向希望快速上手 MCP 协议的开发者,系统梳理了 Model Context Protocol 的生态定位、官方参考服务器的能力矩阵,以及多语言 SDK 覆盖情况。文章以 Claude Desktop 为例,给出从环境准备、独立启动服务器到客户端配置的完整步骤,并说明 Windows 平台适配与多服务器组合方法,帮助读者将 MCP 参考服务器落地到实际开发环境。

model-context-protocol reference-server
阅读更多

训练优化

1 篇
训练优化 2026/7/12

DeepSeek-R1 推理模型与 GRPO 算法解读

本文解读 DeepSeek-R1 系列推理模型及其训练算法 GRPO,分析其如何通过纯强化学习(R1-Zero)及多阶段训练(冷启动、拒绝采样、SFT、RL)激发大模型推理能力,减少对人类标注推理轨迹的依赖,并介绍基于规则的奖励设计与语言一致性优化。

deepseek-r1 grpo
阅读更多

Prompt 工程

2 篇
Prompt 工程 2026/7/12

dair-ai 提示工程指南平台介绍

本文介绍 GitHub 开源项目 dair-ai/Prompt-Engineering-Guide,系统梳理提示工程基础、CoT/ReAct/RAG/AI Agents 等进阶技术、应用场景与模型适配,并总结对抗性提示、事实性与偏见等风险及配套资源,帮助开发者构建从理论到实践的完整学习路径。

prompt-engineering rag
阅读更多