部署实践 2026/7/12
Llama.cpp 本地大模型部署实战
本文介绍如何使用 llama.cpp 在本地或边缘设备上低门槛部署大模型。涵盖纯 C/C++ 架构、多平台硬件适配、量化压缩、CPU+GPU 混合推理及 OpenAI 兼容服务部署,并提供从安装到 API 调用的完整可复现流程,帮助开发者快速构建本地 LLM 应用。
llama-cpp local-llm
阅读更多
本文介绍如何使用 llama.cpp 在本地或边缘设备上低门槛部署大模型。涵盖纯 C/C++ 架构、多平台硬件适配、量化压缩、CPU+GPU 混合推理及 OpenAI 兼容服务部署,并提供从安装到 API 调用的完整可复现流程,帮助开发者快速构建本地 LLM 应用。
vLLM 是一款面向大语言模型推理的高性能开源引擎。文章系统介绍其核心优化技术,包括 PagedAttention、Continuous Batching、Chunked Prefill 等,解析量化、投机解码与分布式推理等加速手段,并说明其广泛的硬件与模型兼容性,帮助读者快速理解并部署该推理平台。
OpenClaw 是一款 local-first、self-hosted 的个人 AI Assistant 平台,旨在将数据与执行控制权交还用户。本文从项目定位与设计理念出发,介绍其以 Gateway 为统一控制平面的架构、20+ 通信渠道与语音唤醒/Live Canvas 等终端交互,演示基于 Node.js 22.19+ 的安装部署、CLI 使用、守护进程与调试模式,并解析多代理路由、模型 failover、ClawHub Skills 工具链,以及 DM pairing、allowlist、sandbox 与执行隔离等安全运维机制,帮助读者在本地构建可控的个人助手中枢。