<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>本地LLM延迟优化实录：缓存会撒谎，慢的从来不是推理 :: x7peeps</title><link>https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/%E6%9C%AC%E5%9C%B0LLM%E5%BB%B6%E8%BF%9F%E4%BC%98%E5%8C%96%E5%AE%9E%E5%BD%95%E7%BC%93%E5%AD%98%E4%BC%9A%E6%92%92%E8%B0%8E%E6%85%A2%E7%9A%84%E4%BB%8E%E6%9D%A5%E4%B8%8D%E6%98%AF%E6%8E%A8%E7%90%86/index.html</link><description>本地 LLM 延迟优化实录：缓存会撒谎，慢的从来不是推理 一句话结论：**本地推理链路的两个"慢"，都不是模型慢。**一个是任务路由场景下前缀缓存"看起来没生效"——官方指标 prompt_eval_count 每次都报全量 token，但墙钟从 8.94s 收敛到 0.39s，指标在撒谎；另一个是语音助手首句要等 13-15 秒——根因是 23GB 模型闲置超时被卸载后的冷加载，热态下大模型首 token 只要 0.07s。修复都不换模型：把变量后置让前缀逐字节命中，用流式首句即播 + 常驻保活把可听延迟压到 2 秒。</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate/><atom:link href="https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/%E6%9C%AC%E5%9C%B0LLM%E5%BB%B6%E8%BF%9F%E4%BC%98%E5%8C%96%E5%AE%9E%E5%BD%95%E7%BC%93%E5%AD%98%E4%BC%9A%E6%92%92%E8%B0%8E%E6%85%A2%E7%9A%84%E4%BB%8E%E6%9D%A5%E4%B8%8D%E6%98%AF%E6%8E%A8%E7%90%86/index.xml" rel="self" type="application/rss+xml"/></channel></rss>