博客
开发者工具使用指南、技术科普与最佳实践。
全部AI AgentAI IDEAI 编程助手AI安全AI工程化AI编程AI编程助手AI编程工具AI编辑器AgentAnthropicBase64CI/CDCSPCSSCacheChromaDBClaudeClaude CodeCopilotCursorDevOpsEmbeddingFunction CallingGitHub CopilotGitLabHTTPSIDEIDE插件INT4JSONKV CacheLLMLLM安全LLM应用开发LLM部署LM StudioLangChainLlamaMCPMLXMarkdownNode.jsOllamaPagedAttentionProductionPrompt InjectionPromptInjectionPrompt注入QdrantRAGRAG安全ReactSEOSSLSecurityTransformerTypeScriptURLUnicodeUnixVS CodeWebGPUWebLLMWeb安全Web开发WindsurfXMLXSSllama.cpptransformers.jsvLLM代码审查代码编辑器代码规范代码重构写作前端向量数据库向量检索图片在线工具安全实战实战经验密码工程实践幻觉开发工具开发效率开发者体验开发者工具开源模型性能优化推理优化提效提示注入提示词插件搜索引擎效率效率工具数据库数据格式文本处理文档时间戳本地推理本地部署格式化检索检索优化检索增强检索增强生成正则表达式流量浏览器推理渗透测试生产力生产实践生产环境生产部署知识库端侧AI端侧推理类型系统编码编程编程助手网站速度计算机基础设计证书语义搜索踩坑经验量化防御方案防御架构隐私保护颜色
标签:#推理优化 · 清除筛选
算法与原理·
KV Cache 到底是什么?面试被问住之后我翻了源码
Transformer 推理优化的基础,但很多人只背了八股文。从源码讲清楚 KV Cache 的原理、显存开销、PagedAttention,以及什么时候不用 KV Cache。
TransformerKV CachePagedAttention推理优化
AI技术·
LLM 推理优化实战:把响应时间从 2s 降到 200ms 的全过程
用 Llama 3 8B 做的聊天机器人项目,通过量化、Flash Attention、Speculative Decoding 等优化,最终延迟降低 91%。
LLM推理优化Llama量化
显示第 1-2 篇,共 2 篇