博客
开发者工具使用指南、技术科普与最佳实践。
全部AI AgentAI IDEAI 编程助手AI安全AI工程化AI编程AI编程助手AI编程工具AI编辑器AgentAnthropicBase64CI/CDCSPCSSCacheChromaDBClaudeClaude CodeCopilotCursorDevOpsEmbeddingFunction CallingGitHub CopilotGitLabHTTPSIDEIDE插件INT4JSONKV CacheLLMLLM安全LLM应用开发LLM部署LM StudioLangChainLlamaMCPMLXMarkdownNode.jsOllamaPagedAttentionProductionPrompt InjectionPromptInjectionPrompt注入QdrantRAGRAG安全ReactSEOSSLSecurityTransformerTypeScriptURLUnicodeUnixVS CodeWebGPUWebLLMWeb安全Web开发WindsurfXMLXSSllama.cpptransformers.jsvLLM代码审查代码编辑器代码规范代码重构写作前端向量数据库向量检索图片在线工具安全实战实战经验密码工程实践幻觉开发工具开发效率开发者体验开发者工具开源模型性能优化推理优化提效提示注入提示词插件搜索引擎效率效率工具数据库数据格式文本处理文档时间戳本地推理本地部署格式化检索检索优化检索增强检索增强生成正则表达式流量浏览器推理渗透测试生产力生产实践生产环境生产部署知识库端侧AI端侧推理类型系统编码编程编程助手网站速度计算机基础设计证书语义搜索踩坑经验量化防御方案防御架构隐私保护颜色
端侧与硬件·
INT4量化实战:把7B模型塞进手机,踩坑全记录
上周把 Llama 3.1 8B 做了 INT4 量化,装进 iPhone 15 Pro 跑推理。过程挺曲折,把踩的坑都记下来。
INT4量化端侧AIllama.cppMLX
前端与全栈·
浏览器端跑LLM:WebGPU推理的现在与将来
WebGPU 推理目前就是个"能用但别指望多好用"的状态,但它确实解决了一个实际问题——隐私敏感场景下数据无需离开设备。
WebGPU浏览器推理LLMWebLLMtransformers.js
AI工具·
Cursor 实战:从新手到熟练的7个高级技巧
用了一年Cursor后总结的实战经验,这些技巧官方文档不会告诉你,能显著提升编程效率
CursorAI编程效率工具
端侧与硬件·
llama.cpp 本地推理实战:从安装到优化的完整指南
一线开发者实测:如何在消费级硬件上跑起LLM,量化带来的精度损失到底有多少,以及那些文档里没写踩坑记录
llama.cpp量化本地推理端侧AI
算法与原理·
KV Cache 到底是什么?面试被问住之后我翻了源码
Transformer 推理优化的基础,但很多人只背了八股文。从源码讲清楚 KV Cache 的原理、显存开销、PagedAttention,以及什么时候不用 KV Cache。
TransformerKV CachePagedAttention推理优化
开源生态·
vLLM、Ollama、LM Studio 横评:自托管 LLM 到底该选谁?
试了一圈主流自托管方案,从吞吐实测到踩坑复盘,帮你找到最适合你场景的 LLM 部署方式。
vLLMOllamaLM StudioLLM部署开源模型
显示第 1-6 篇,共 94 篇