<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>AI :: 标签 :: x7peeps</title><link>https://x7peeps.com/tags/AI/index.html</link><description/><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 19 Aug 2026 10:03:24 +0000</lastBuildDate><atom:link href="https://x7peeps.com/tags/AI/index.xml" rel="self" type="application/rss+xml"/><item><title>让AI看着屏幕操作电脑：本地视觉闭环的基准评测与工程验证</title><link>https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/%E8%AE%A9AI%E7%9C%8B%E7%9D%80%E5%B1%8F%E5%B9%95%E6%93%8D%E4%BD%9C%E7%94%B5%E8%84%91-%E6%9C%AC%E5%9C%B0%E8%A7%86%E8%A7%89%E9%97%AD%E7%8E%AF%E7%9A%84%E5%9F%BA%E5%87%86%E8%AF%84%E6%B5%8B%E4%B8%8E%E5%B7%A5%E7%A8%8B%E9%AA%8C%E8%AF%81/index.html</link><pubDate>Wed, 19 Aug 2026 10:03:24 +0000</pubDate><guid>https://x7peeps.com/AI/06-AI%E5%B7%A5%E7%A8%8B%E5%8C%96/%E8%AE%A9AI%E7%9C%8B%E7%9D%80%E5%B1%8F%E5%B9%95%E6%93%8D%E4%BD%9C%E7%94%B5%E8%84%91-%E6%9C%AC%E5%9C%B0%E8%A7%86%E8%A7%89%E9%97%AD%E7%8E%AF%E7%9A%84%E5%9F%BA%E5%87%86%E8%AF%84%E6%B5%8B%E4%B8%8E%E5%B7%A5%E7%A8%8B%E9%AA%8C%E8%AF%81/index.html</guid><description>让 AI「看着屏幕」操作电脑：本地视觉闭环的基准评测与工程验证 摘要 AI Agent 操作电脑的主流方案（截图 + 云端视觉模型）单步延迟 4-15 秒，token 消耗高。本文提出并验证一条本地化技术路线：以 AX（Accessibility）作为快速执行层，以本地视觉模型（Qwen2.5-VL-7B + ShowUI-2B）作为「看屏-决策-验证」层，配以 verify-loop 防误报框架，实现「目标窗口路由」的安全点击。通过严谨的基准评测（基准延迟对比、误报案例归因、2 场景 × 3 轮采样的定位/理解/决策评测、3 个端到端真实任务）验证：AX 单步 94ms（快 10-150 倍）；ShowUI-2B 定位归一化偏差 0.026（±0.000）；Qwen2.5-VL-7B 理解/决策与 72B 同效（决策命中 1.00）且快 5-7 倍；端到端任务（音乐双平台发布、Suno 音乐库检索、WPS 数据透视表）全部跑通。最终将 4 个候选模型精简为 2 个，并沉淀 5 类工程坑（坐标系统、全局点击、CEF 应用、隐私屏、远程会话）。结果表明：本地视觉闭环在延迟、成本、可靠性上全面优于云 VLM 方案，具备封装为可复用「视觉 Agent 框架」的工程基础。</description></item></channel></rss>