<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>补充本地MLX流式TTS特性的研究 :: x7peeps</title><link>https://x7peeps.com/%E5%BC%80%E6%BA%90%E9%A1%B9%E7%9B%AE/hermes%E6%96%B0%E7%89%B9%E6%80%A7/%E8%A1%A5%E5%85%85%E6%9C%AC%E5%9C%B0MLX%E6%B5%81%E5%BC%8FTTS%E7%89%B9%E6%80%A7%E7%9A%84%E7%A0%94%E7%A9%B6/index.html</link><description>PR 地址：NousResearch/hermes-agent#85071 · 本地 MLX Qwen3-TTS 流式 provider（qwen3tts-mlx）
研究摘要 Hermes 的会话语音（session speech、语音气泡）原本依赖云端流式 TTS provider（elevenlabs / openai / gemini / xai），本地 TTS 引擎只能走同步合成路径——每说一句话，都要完整跑一次模型加载 + 整段文本合成，延迟高达 47 秒。本研究向 Hermes 上游补充了一个本地 MLX 流式 TTS provider（qwen3tts-mlx），把 Apple Silicon 上 Qwen3-TTS 声音克隆引擎的逐句流式产出能力接入既有流式管线：实测 4 段文本在 t=4.2s / 7.6s / 11.6s / 16.9s 依次产出，对比整 buffer 一次合成的 47s，端到端感知延迟降低一个数量级，且全程本地推理、无云端依赖、支持自定义克隆音色。</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate/><atom:link href="https://x7peeps.com/%E5%BC%80%E6%BA%90%E9%A1%B9%E7%9B%AE/hermes%E6%96%B0%E7%89%B9%E6%80%A7/%E8%A1%A5%E5%85%85%E6%9C%AC%E5%9C%B0MLX%E6%B5%81%E5%BC%8FTTS%E7%89%B9%E6%80%A7%E7%9A%84%E7%A0%94%E7%A9%B6/index.xml" rel="self" type="application/rss+xml"/></channel></rss>