ARTICLE / ai

让AI看着屏幕操作电脑:本地视觉闭环的基准评测与工程验证

让 AI「看着屏幕」操作电脑:本地视觉闭环的基准评测与工程验证

摘要

AI Agent 操作电脑的主流方案(截图 + 云端视觉模型)单步延迟 4-15 秒,token 消耗高。本文提出并验证一条本地化技术路线:以 AX(Accessibility)作为快速执行层,以本地视觉模型(Qwen2.5-VL-7B + ShowUI-2B)作为「看屏-决策-验证」层,配以 verify-loop 防误报框架,实现「目标窗口路由」的安全点击。通过严谨的基准评测(基准延迟对比、误报案例归因、2 场景 × 3 轮采样的定位/理解/决策评测、3 个端到端真实任务)验证:AX 单步 94ms(快 10-150 倍);ShowUI-2B 定位归一化偏差 0.026(±0.000);Qwen2.5-VL-7B 理解/决策与 72B 同效(决策命中 1.00)且快 5-7 倍;端到端任务(音乐双平台发布、Suno 音乐库检索、WPS 数据透视表)全部跑通。最终将 4 个候选模型精简为 2 个,并沉淀 5 类工程坑(坐标系统、全局点击、CEF 应用、隐私屏、远程会话)。结果表明:本地视觉闭环在延迟、成本、可靠性上全面优于云 VLM 方案,具备封装为可复用「视觉 Agent 框架」的工程基础。


1. 研究问题

本文围绕四个递进的研究问题(RQ):

  • RQ1:AX-first(ghost-os)相对 computer_use(截图+云 VLM)在延迟上快多少?代价是什么?
  • RQ2:AX 的「成功报告」是否可靠?误报的典型模式与根因是什么?
  • RQ3:本地视觉模型能否承担「看屏-决策-验证」职责?4 个候选模型(Qwen2.5-VL-72B / Qwen2.5-VL-7B / ShowUI-2B / UI-TARS-7B)的能力边界如何?
  • RQ4:在上述结论下,最优的模型组合与执行架构是什么?能否端到端完成真实任务?

2. 背景与相关工作

方案机制延迟/步依赖可靠性
computer_use(cua-driver)截图 + 云端 VLM 理解 + 合成事件4-15s外部 API / token中(无内置验证)
AX-first(ghost-os)macOS Accessibility 树直读 + AX 点击94ms本地低(坐标/事件盲区)
开源 GUI 模型(UI-TARS/ShowUI 等)截图 → 输出动作/坐标2-13s本地推理待评测(本文 RQ3)

相关工作调研结论:云端 VLM 慢而贵;AX 快但盲;开源 GUI 模型定位能力参差——需要本地视觉闭环 + 验证框架的组合,并用严谨评测量化各环节能力

3. 方法论

3.1 verify-loop 防误报框架

执行(AX/CDP)→ 验证① CDP DOM 回读(~0ms)→ 验证② 截图+OCR(~0.2s)→ 验证③ 本地视觉模型(按需)

核心原则:AX 只是执行器,不承担确认职责;每步动作 = 执行 + 验证 + 回退。

3.2 评测设计(Benchmark 协议)

  • 测试集:2 个真实页面场景(Suno Library 导航项 / 腾讯音乐人「发布AI作品」卡片),每场景采集 DOM ground truth(归一化坐标)。
  • 采样:每模型每场景 3 轮采样(温度 0.1),报告平均偏差 ± 标准差。
  • 指标
    • 定位偏差 = 模型输出归一化坐标与 ground truth 的欧氏距离(<0.05 优秀 / <0.1 可用)
    • 理解/决策 = 标准答案关键词命中率(0-1)
    • 延迟 = 端到端推理时间
  • 环境:MacBook Pro M5 Max 128GB;Qwen2.5-VL-72B(GGUF Q4,llama.cpp);Qwen2.5-VL-7B(MLX 4bit,mlx-vlm 0.6.15);ShowUI-2B(MLX 4bit,vision-sidecar);UI-TARS-7B(GGUF Q4,llama.cpp)。

4. 实验

4.1 RQ1:AX vs computer_use 基准

指标computer_useAX-first(ghost-os)提升
单步操作4-15s94ms10-150×
建文件夹(实测)~20s5.3s~4×
焦点抢占可能抢焦点后台读取不抢

结论:RQ1 成立——AX-first 快 10-150 倍,且后台读取不干扰用户。

图1 单步操作延迟对比(对数轴) 图1 单步操作延迟对比(对数轴)

4.2 RQ2:AX 误报归因(4 类实证案例)

#案例AX 报告实际根因
1QQ「下一步」success页面无跳转前端 Vue 事件未触发,AX 事件投递无效
2Tabbit AX 树坐标可用元素全报 y=81应用 AX 坐标实现错位
3letsign 签署success坐标偏移som bounds 原生坐标 vs 逻辑坐标换算错误
4文件对话框无可操作自动化死路应用内部渲染对话框,AX 树缺失

结论:RQ2 成立——AX 误报是系统性的,必须引入验证层(verify-loop)。

4.3 RQ3:本地视觉模型能力评测

定位能力(归一化偏差,3 轮采样):

模型Suno LibraryQQ 发布AI作品平均速度
ShowUI-2B0.027±0.0000.025±0.0000.0262s
Qwen2.5-VL-72B0.099±0.0020.041±0.0000.07024s
Qwen2.5-VL-7B0.287±0.0000.241±0.0000.26413s
UI-TARS-7B0.142±0.0000.525±0.0010.3332s

理解/决策能力(关键词命中率):

模型页面理解操作决策速度
Qwen2.5-VL-72B1.0064-105s
Qwen2.5-VL-7B1.0013-16s

发现

  1. 定位:ShowUI-2B 唯一优秀(0.026,稳定 ±0.000);
  2. 理解/决策:7B 与 72B 同效(决策命中 1.00),7B 快 5-7 倍;
  3. UI-TARS-7B 定位不可靠(平均 0.333,跨场景波动 0.142-0.525)。

图2 4 模型定位能力对比(归一化偏差,均值±标准差) 图2 4 模型定位能力对比(归一化偏差,均值±标准差)

图3 理解/决策能力对比:Qwen-72B vs Qwen-7B 图3 理解/决策能力对比:Qwen-72B vs Qwen-7B

4.4 RQ4:端到端真实任务(3 个)

  1. AI 音乐作品双平台发布:抖音表单全自动 + 短信验证码签署全自动;QQ 表单自动填写 95%(剩余人工补专辑设置);双平台全线上线——Qwen-VL 验证发布状态(抖音「字节系平台已发行」+ QQ 搜索 API 命中)。
  2. 视觉控制 Suno 音乐库检索:导航 → 决策点 Library → 目标窗口点击 → URL 跳转 suno.com/me → Qwen-VL 验证(识别 5 首历史生成版本 + DOM 交叉确认)。
  3. WPS 数据透视表(视觉模型全程):新建表格 → 粘贴数据(产品/地区/销量/月份)→ 切数据选项卡 → 菜单路径打开透视表向导 → 确定 → 数据透视表创建(Qwen-7B 验证:行标签/列标签/求和项/字段列表)。

4.5 截图证据链

任务 2:视觉控制 Suno 音乐库检索(导航后 Qwen-VL 验证截图——识别 5 首历史生成版本 + Library 导航):

图4 Suno 音乐库验证(Qwen-VL 识别 5 首历史版本 + Library 导航) 图4 Suno 音乐库验证(Qwen-VL 识别 5 首历史版本 + Library 导航)

任务 3:WPS 数据透视表(最终验证截图——数据透视表创建:行标签/列标签/求和项/字段列表):

图5 WPS 数据透视表创建成功(Qwen-7B 视觉验证) 图5 WPS 数据透视表创建成功(Qwen-7B 视觉验证)

评测场景样例(Benchmark 测试集——Suno Library 场景 / 腾讯音乐人发布场景):

图6 评测场景:Suno Library 图6 评测场景:Suno Library

图7 评测场景:腾讯音乐人发布AI作品卡片 图7 评测场景:腾讯音乐人发布AI作品卡片

5. 讨论

5.1 主要发现

  1. 本地视觉闭环全面优于云 VLM:延迟(94ms-2s vs 4-15s)、成本(0 token)、可靠性(每步验证)三方面胜出。
  2. 模型分工优于单模型全能:定位(ShowUI)与语义(Qwen-7B)分离,各取所长——4 模型精简为 2 模型。
  3. 验证层是可靠性地基:RQ2 的 4 类误报若无验证层全部会翻车。

5.2 局限

  1. 评测测试集 2 场景规模偏小(需扩展至 10+ 场景);
  2. WPS 等 CEF 应用功能区按钮合成点击无效(需人工辅助或应用级 API);
  3. 全局点击(CGEvent)会误点用户正在操作的软件——已收敛到「目标窗口路由」(cua-driver pid+window_id);
  4. 远程会话(AweSun)隐私屏会锁全屏帧,需用 CDP/窗口级截图规避。

5.3 工程坑清单(可复用)

#解法
1视觉模型直接输出坐标不可靠(小图偏 2 倍)截图宽 ≥900px;坐标交给 ShowUI/DOM
2CGEvent 全局点击误点只用 cua-driver 目标窗口路由(pid+window_id)
3CEF 应用(WPS)按钮不响应合成点击走原生菜单路径(数据→数据透视表)
4AweSun 隐私屏锁全屏帧CDP/窗口级截图(不需录屏权限)
5远程会话坐标偏移CGWindowList 实时取窗口位置,不缓存

6. 结论

本文以基准评测与工程验证回答了四个 RQ:AX-first 快 10-150 倍(RQ1);AX 误报系统性存在、必须验证层(RQ2);本地视觉模型中 ShowUI-2B 定位 0.026、Qwen-7B 语义/决策与 72B 同效且快 5-7 倍(RQ3);最终架构 = ShowUI-2B(定位)+ Qwen2.5-VL-7B(大脑)+ CDP/AX(目标窗口路由执行)+ verify-loop(验证)——3 个端到端真实任务全部跑通(RQ4)。

下一步:将该闭环封装为可复用「视觉 Agent 框架」(任务描述 → 截图循环 → 决策/定位/执行/验证 标准 API),使任意桌面任务可「看着屏幕自己干」。