<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>补充MCP图像视觉桥接特性的研究 :: x7peeps</title><link>https://x7peeps.com/%E5%BC%80%E6%BA%90%E9%A1%B9%E7%9B%AE/hermes%E6%96%B0%E7%89%B9%E6%80%A7/%E8%A1%A5%E5%85%85MCP%E5%9B%BE%E5%83%8F%E8%A7%86%E8%A7%89%E6%A1%A5%E6%8E%A5%E7%89%B9%E6%80%A7%E7%9A%84%E7%A0%94%E7%A9%B6/index.html</link><description>PR 地址：NousResearch/hermes-agent#85994 · 把 MCP ImageContent 桥接到辅助视觉模型摘要，让纯文本主模型"看见"图像
研究摘要 之前，返回 ImageContent 块的 MCP 工具（浏览器截图、read_image、read_video 帧）对纯文本主模型是彻底盲目的：Hermes 缓存图片字节后只交给模型一个裸 MEDIA:&lt;path&gt; 标签，对纯文本 provider 而言这个标签携带零像素信息（Qwen-MM-Plugins 官方手册确认"provider 收不到图像像素"）。手动调用 vision_analyze 可以补救，但要求模型记得自己是盲的并主动调第二个工具——这是会反复出现的失败模式。现在，配置了 auxiliary.vision 后，MCP 图像块在缓存后由辅助视觉模型描述一次，文本摘要随 MEDIA: 标签一起输出（双轨输出），纯文本模型从"完全看不见"变成"看到完整描述"。</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate/><atom:link href="https://x7peeps.com/%E5%BC%80%E6%BA%90%E9%A1%B9%E7%9B%AE/hermes%E6%96%B0%E7%89%B9%E6%80%A7/%E8%A1%A5%E5%85%85MCP%E5%9B%BE%E5%83%8F%E8%A7%86%E8%A7%89%E6%A1%A5%E6%8E%A5%E7%89%B9%E6%80%A7%E7%9A%84%E7%A0%94%E7%A9%B6/index.xml" rel="self" type="application/rss+xml"/></channel></rss>