端侧与硬件·

INT4量化实战:把7B模型塞进手机,踩坑全记录

上周把 Llama 3.1 8B 做了 INT4 量化,装进 iPhone 15 Pro 跑推理。过程挺曲折,把踩的坑都记下来。

INT4量化端侧AIllama.cppMLX
前端与全栈·

浏览器端跑LLM:WebGPU推理的现在与将来

WebGPU 推理目前就是个"能用但别指望多好用"的状态,但它确实解决了一个实际问题——隐私敏感场景下数据无需离开设备。

WebGPU浏览器推理LLMWebLLMtransformers.js
AI工具·

Cursor 实战:从新手到熟练的7个高级技巧

用了一年Cursor后总结的实战经验,这些技巧官方文档不会告诉你,能显著提升编程效率

CursorAI编程效率工具
端侧与硬件·

llama.cpp 本地推理实战:从安装到优化的完整指南

一线开发者实测:如何在消费级硬件上跑起LLM,量化带来的精度损失到底有多少,以及那些文档里没写踩坑记录

llama.cpp量化本地推理端侧AI
算法与原理·

KV Cache 到底是什么?面试被问住之后我翻了源码

Transformer 推理优化的基础,但很多人只背了八股文。从源码讲清楚 KV Cache 的原理、显存开销、PagedAttention,以及什么时候不用 KV Cache。

TransformerKV CachePagedAttention推理优化
开源生态·

vLLM、Ollama、LM Studio 横评:自托管 LLM 到底该选谁?

试了一圈主流自托管方案,从吞吐实测到踩坑复盘,帮你找到最适合你场景的 LLM 部署方式。

vLLMOllamaLM StudioLLM部署开源模型

显示第 1-6 篇,共 94