博客
开发者工具使用指南、技术科普与最佳实践。
全部AI AgentAI IDEAI 编程助手AI安全AI工程化AI编程AI编程助手AI编程工具AI编辑器AgentAnthropicBase64CI/CDCSPCSSCacheChromaDBClaudeClaude CodeCopilotCursorDevOpsEmbeddingFunction CallingGitHub CopilotGitLabHTTPSIDEIDE插件INT4JSONKV CacheLLMLLM安全LLM应用开发LLM部署LM StudioLangChainLlamaMCPMLXMarkdownNode.jsOllamaPagedAttentionProductionPrompt InjectionPromptInjectionPrompt注入QdrantRAGRAG安全ReactSEOSSLSecurityTransformerTypeScriptURLUnicodeUnixVS CodeWebGPUWebLLMWeb安全Web开发WindsurfXMLXSSllama.cpptransformers.jsvLLM代码审查代码编辑器代码规范代码重构写作前端向量数据库向量检索图片在线工具安全实战实战经验密码工程实践幻觉开发工具开发效率开发者体验开发者工具开源模型性能优化推理优化提效提示注入提示词插件搜索引擎效率效率工具数据库数据格式文本处理文档时间戳本地推理本地部署格式化检索检索优化检索增强检索增强生成正则表达式流量浏览器推理渗透测试生产力生产实践生产环境生产部署知识库端侧AI端侧推理类型系统编码编程编程助手网站速度计算机基础设计证书语义搜索踩坑经验量化防御方案防御架构隐私保护颜色
标签:#Llama · 清除筛选
端侧与硬件·
INT4量化实战:把7B模型塞进手机,踩坑全记录
上周把 Llama 3.1 8B 做了 INT4 量化,装进 iPhone 15 Pro 跑推理。过程挺曲折,把踩的坑都记下来。
INT4量化端侧AIllama.cppMLX
端侧与硬件·
llama.cpp 本地推理实战:从安装到优化的完整指南
一线开发者实测:如何在消费级硬件上跑起LLM,量化带来的精度损失到底有多少,以及那些文档里没写踩坑记录
llama.cpp量化本地推理端侧AI
开源生态·
vLLM、Ollama、LM Studio 横评:自托管 LLM 到底该选谁?
试了一圈主流自托管方案,从吞吐实测到踩坑复盘,帮你找到最适合你场景的 LLM 部署方式。
vLLMOllamaLM StudioLLM部署开源模型
端侧与硬件·
本地跑 LLM 不崩溃:我的 llama.cpp 实战踩坑录
从模型选型到量化方案,手把手教你在本地稳定运行 LLM,附真实踩坑经验。
LLMllama.cpp端侧推理量化
AI技术·
本地部署 LLM:从 Ollama 到 vLLM,生产环境的三个真实坑
从显存估算到并发调优,本地部署大语言模型在生产环境的真实踩坑记录和解决方案。
LLMvLLMOllama本地部署量化
AI技术·
LLM 推理优化实战:把响应时间从 2s 降到 200ms 的全过程
用 Llama 3 8B 做的聊天机器人项目,通过量化、Flash Attention、Speculative Decoding 等优化,最终延迟降低 91%。
LLM推理优化Llama量化
显示第 1-6 篇,共 6 篇