<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>并行计算 :: 标签 :: x7peeps</title><link>https://x7peeps.com/tags/%E5%B9%B6%E8%A1%8C%E8%AE%A1%E7%AE%97/index.html</link><description/><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 13 Aug 2026 04:17:28 +0000</lastBuildDate><atom:link href="https://x7peeps.com/tags/%E5%B9%B6%E8%A1%8C%E8%AE%A1%E7%AE%97/index.xml" rel="self" type="application/rss+xml"/><item><title>MLX 并行提速实录：macOS 本地 TTS 从 230 秒到 100 秒</title><link>https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/MLX%E5%B9%B6%E8%A1%8C%E6%8F%90%E9%80%9F%E5%AE%9E%E5%BD%95macOS%E6%9C%AC%E5%9C%B0TTS%E4%BB%8E230%E7%A7%92%E5%88%B0100%E7%A7%92/index.html</link><pubDate>Thu, 13 Aug 2026 04:17:28 +0000</pubDate><guid>https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/MLX%E5%B9%B6%E8%A1%8C%E6%8F%90%E9%80%9F%E5%AE%9E%E5%BD%95macOS%E6%9C%AC%E5%9C%B0TTS%E4%BB%8E230%E7%A7%92%E5%88%B0100%E7%A7%92/index.html</guid><description>MLX 并行提速实录：macOS 本地 TTS 从 230 秒到 100 秒 一句话结论：引入 Apple MLX 框架 + 4 进程池并行分块，在不替换模型、不牺牲音质的前提下，将本地 TTS 长文本生成从 230.7 秒降至 100.2 秒（RTF 1.25→0.53），短文本从 11.5 秒降至 7.5-8 秒，冷启动从 11 秒降至 1-2 秒。 核心发现是：MLX 单进程并不比调优后的 PyTorch 并行快，真正的提速来自「MLX GPU 推理 × 受控多进程并行」的组合；而并发失控（18 进程）会导致内存与 GPU 初始化风暴，必须使用进程池限流。</description></item></channel></rss>