ARTICLE / ai
让AI看着屏幕操作电脑:本地视觉闭环的基准评测与工程验证
让 AI「看着屏幕」操作电脑:本地视觉闭环的基准评测与工程验证
摘要
AI Agent 操作电脑的主流方案(截图 + 云端视觉模型)单步延迟 4-15 秒,token 消耗高。本文提出并验证一条本地化技术路线:以 AX(Accessibility)作为快速执行层,以本地视觉模型(Qwen2.5-VL-7B + ShowUI-2B)作为「看屏-决策-验证」层,配以 verify-loop 防误报框架,实现「目标窗口路由」的安全点击。通过严谨的基准评测(基准延迟对比、误报案例归因、2 场景 × 3 轮采样的定位/理解/决策评测、3 个端到端真实任务)验证:AX 单步 94ms(快 10-150 倍);ShowUI-2B 定位归一化偏差 0.026(±0.000);Qwen2.5-VL-7B 理解/决策与 72B 同效(决策命中 1.00)且快 5-7 倍;端到端任务(音乐双平台发布、Suno 音乐库检索、WPS 数据透视表)全部跑通。最终将 4 个候选模型精简为 2 个,并沉淀 5 类工程坑(坐标系统、全局点击、CEF 应用、隐私屏、远程会话)。结果表明:本地视觉闭环在延迟、成本、可靠性上全面优于云 VLM 方案,具备封装为可复用「视觉 Agent 框架」的工程基础。
1. 研究问题
本文围绕四个递进的研究问题(RQ):
- RQ1:AX-first(ghost-os)相对 computer_use(截图+云 VLM)在延迟上快多少?代价是什么?
- RQ2:AX 的「成功报告」是否可靠?误报的典型模式与根因是什么?
- RQ3:本地视觉模型能否承担「看屏-决策-验证」职责?4 个候选模型(Qwen2.5-VL-72B / Qwen2.5-VL-7B / ShowUI-2B / UI-TARS-7B)的能力边界如何?
- RQ4:在上述结论下,最优的模型组合与执行架构是什么?能否端到端完成真实任务?
2. 背景与相关工作
| 方案 | 机制 | 延迟/步 | 依赖 | 可靠性 |
|---|---|---|---|---|
| computer_use(cua-driver) | 截图 + 云端 VLM 理解 + 合成事件 | 4-15s | 外部 API / token | 中(无内置验证) |
| AX-first(ghost-os) | macOS Accessibility 树直读 + AX 点击 | 94ms | 本地 | 低(坐标/事件盲区) |
| 开源 GUI 模型(UI-TARS/ShowUI 等) | 截图 → 输出动作/坐标 | 2-13s | 本地推理 | 待评测(本文 RQ3) |
相关工作调研结论:云端 VLM 慢而贵;AX 快但盲;开源 GUI 模型定位能力参差——需要本地视觉闭环 + 验证框架的组合,并用严谨评测量化各环节能力。
3. 方法论
3.1 verify-loop 防误报框架
核心原则:AX 只是执行器,不承担确认职责;每步动作 = 执行 + 验证 + 回退。
3.2 评测设计(Benchmark 协议)
- 测试集:2 个真实页面场景(Suno Library 导航项 / 腾讯音乐人「发布AI作品」卡片),每场景采集 DOM ground truth(归一化坐标)。
- 采样:每模型每场景 3 轮采样(温度 0.1),报告平均偏差 ± 标准差。
- 指标:
- 定位偏差 = 模型输出归一化坐标与 ground truth 的欧氏距离(<0.05 优秀 / <0.1 可用)
- 理解/决策 = 标准答案关键词命中率(0-1)
- 延迟 = 端到端推理时间
- 环境:MacBook Pro M5 Max 128GB;Qwen2.5-VL-72B(GGUF Q4,llama.cpp);Qwen2.5-VL-7B(MLX 4bit,mlx-vlm 0.6.15);ShowUI-2B(MLX 4bit,vision-sidecar);UI-TARS-7B(GGUF Q4,llama.cpp)。
4. 实验
4.1 RQ1:AX vs computer_use 基准
| 指标 | computer_use | AX-first(ghost-os) | 提升 |
|---|---|---|---|
| 单步操作 | 4-15s | 94ms | 10-150× |
| 建文件夹(实测) | ~20s | 5.3s | ~4× |
| 焦点抢占 | 可能抢焦点 | 后台读取不抢 | — |
结论:RQ1 成立——AX-first 快 10-150 倍,且后台读取不干扰用户。
4.2 RQ2:AX 误报归因(4 类实证案例)
| # | 案例 | AX 报告 | 实际 | 根因 |
|---|---|---|---|---|
| 1 | QQ「下一步」 | success | 页面无跳转 | 前端 Vue 事件未触发,AX 事件投递无效 |
| 2 | Tabbit AX 树 | 坐标可用 | 元素全报 y=81 | 应用 AX 坐标实现错位 |
| 3 | letsign 签署 | success | 坐标偏移 | som bounds 原生坐标 vs 逻辑坐标换算错误 |
| 4 | 文件对话框 | 无可操作 | 自动化死路 | 应用内部渲染对话框,AX 树缺失 |
结论:RQ2 成立——AX 误报是系统性的,必须引入验证层(verify-loop)。
4.3 RQ3:本地视觉模型能力评测
定位能力(归一化偏差,3 轮采样):
| 模型 | Suno Library | QQ 发布AI作品 | 平均 | 速度 |
|---|---|---|---|---|
| ShowUI-2B | 0.027±0.000 | 0.025±0.000 | 0.026 | 2s |
| Qwen2.5-VL-72B | 0.099±0.002 | 0.041±0.000 | 0.070 | 24s |
| Qwen2.5-VL-7B | 0.287±0.000 | 0.241±0.000 | 0.264 | 13s |
| UI-TARS-7B | 0.142±0.000 | 0.525±0.001 | 0.333 | 2s |
理解/决策能力(关键词命中率):
| 模型 | 页面理解 | 操作决策 | 速度 |
|---|---|---|---|
| Qwen2.5-VL-72B | ✅ | 1.00 | 64-105s |
| Qwen2.5-VL-7B | ✅ | 1.00 | 13-16s |
发现:
- 定位:ShowUI-2B 唯一优秀(0.026,稳定 ±0.000);
- 理解/决策:7B 与 72B 同效(决策命中 1.00),7B 快 5-7 倍;
- UI-TARS-7B 定位不可靠(平均 0.333,跨场景波动 0.142-0.525)。
4.4 RQ4:端到端真实任务(3 个)
- AI 音乐作品双平台发布:抖音表单全自动 + 短信验证码签署全自动;QQ 表单自动填写 95%(剩余人工补专辑设置);双平台全线上线——Qwen-VL 验证发布状态(抖音「字节系平台已发行」+ QQ 搜索 API 命中)。
- 视觉控制 Suno 音乐库检索:导航 → 决策点 Library → 目标窗口点击 → URL 跳转 suno.com/me → Qwen-VL 验证(识别 5 首历史生成版本 + DOM 交叉确认)。
- WPS 数据透视表(视觉模型全程):新建表格 → 粘贴数据(产品/地区/销量/月份)→ 切数据选项卡 → 菜单路径打开透视表向导 → 确定 → 数据透视表创建(Qwen-7B 验证:行标签/列标签/求和项/字段列表)。
4.5 截图证据链
任务 2:视觉控制 Suno 音乐库检索(导航后 Qwen-VL 验证截图——识别 5 首历史生成版本 + Library 导航):
任务 3:WPS 数据透视表(最终验证截图——数据透视表创建:行标签/列标签/求和项/字段列表):
评测场景样例(Benchmark 测试集——Suno Library 场景 / 腾讯音乐人发布场景):
5. 讨论
5.1 主要发现
- 本地视觉闭环全面优于云 VLM:延迟(94ms-2s vs 4-15s)、成本(0 token)、可靠性(每步验证)三方面胜出。
- 模型分工优于单模型全能:定位(ShowUI)与语义(Qwen-7B)分离,各取所长——4 模型精简为 2 模型。
- 验证层是可靠性地基:RQ2 的 4 类误报若无验证层全部会翻车。
5.2 局限
- 评测测试集 2 场景规模偏小(需扩展至 10+ 场景);
- WPS 等 CEF 应用功能区按钮合成点击无效(需人工辅助或应用级 API);
- 全局点击(CGEvent)会误点用户正在操作的软件——已收敛到「目标窗口路由」(cua-driver pid+window_id);
- 远程会话(AweSun)隐私屏会锁全屏帧,需用 CDP/窗口级截图规避。
5.3 工程坑清单(可复用)
| # | 坑 | 解法 |
|---|---|---|
| 1 | 视觉模型直接输出坐标不可靠(小图偏 2 倍) | 截图宽 ≥900px;坐标交给 ShowUI/DOM |
| 2 | CGEvent 全局点击误点 | 只用 cua-driver 目标窗口路由(pid+window_id) |
| 3 | CEF 应用(WPS)按钮不响应合成点击 | 走原生菜单路径(数据→数据透视表) |
| 4 | AweSun 隐私屏锁全屏帧 | CDP/窗口级截图(不需录屏权限) |
| 5 | 远程会话坐标偏移 | CGWindowList 实时取窗口位置,不缓存 |
6. 结论
本文以基准评测与工程验证回答了四个 RQ:AX-first 快 10-150 倍(RQ1);AX 误报系统性存在、必须验证层(RQ2);本地视觉模型中 ShowUI-2B 定位 0.026、Qwen-7B 语义/决策与 72B 同效且快 5-7 倍(RQ3);最终架构 = ShowUI-2B(定位)+ Qwen2.5-VL-7B(大脑)+ CDP/AX(目标窗口路由执行)+ verify-loop(验证)——3 个端到端真实任务全部跑通(RQ4)。
下一步:将该闭环封装为可复用「视觉 Agent 框架」(任务描述 → 截图循环 → 决策/定位/执行/验证 标准 API),使任意桌面任务可「看着屏幕自己干」。






