
在《移动端自动化工具汇总》总结过常见的开源移动端自动化工具,大部分的项目基本上发布后就很少更新维护。
最近有一个新的开源项目 OpenDroid 是移动端自动化工具赛道上一个功能比较完整的实现,值得推荐。
OpenDroid:https://github.com/yashab-cyber/opendroid/
OpenDroid 是跑在 Android 上的生产级自主 AI Agent,能通过本地/远程大模型 + 无障碍服务,自己规划、执行、验证并修正多步骤任务。
官方给出的典型例子是”查一下会不会下雨,如果会下雨就给我老婆发短信说我会晚点到,再设一个晚上六点的闹钟”,此类跨应用、多步骤、带条件判断的任务链正是 OpenDroid 的设计核心。
OpenDroid 核心功能:
- 自主规划与再评估:将高层指令拆解为顺序子任务,逐步执行并验证结果,失败时动态调整剩余步骤,而不是一次性生成固定脚本。
- 系统级设备控制:亮度调节、Wi-Fi/蓝牙/手电筒开关、锁屏、闹钟/计时器、日历管理、语言与货币转换等原生系统动作。
- Accessibility 自动化兜底:通过自研的 JarvisAccessibilityService,在没有系统 API 可用时(比如在 WhatsApp 里发消息、在地图里查地点),用点击、滚动、读屏的方式模拟人工操作。
- 多 LLM 统一接入层:支持 Claude、OpenAI、Gemini、Mistral、Groq、Ollama、OpenRouter、Together AI、Cohere、DeepSeek 等十余家供应商互换,并在触发限速时自动做故障转移链路切换。
- 四层持久化记忆系统:工作记忆(当前计划的临时上下文与执行变量)、情景记忆(历史动作序列日志)、语义记忆(由 LLM 抽取的结构化长期个人事实与偏好)、程序记忆(用户自定义的宏工作流)。
- 本地唤醒词与语音交互:离线唤醒词检测 + Android 自带语音识别 + 高保真 TTS(可选 ElevenLabs 兜底)。
- 视觉屏幕理解:通过 Accessibility API 截图并喂给多模态 LLM 做实时屏幕分析,在旧设备上则退化为无障碍树的文本抓取。
由于 OpenDroid 需要较高权限,尤其无障碍服务权限一旦授予,能读取屏幕上几乎所有内容,叠加”写入系统设置”和”录音”权限,攻击面相当大,因此建议:
- 只在自己完全控制的设备上安装。
- 优先使用本地模型(Ollama / Gemma )处理敏感操作。
- 对支付、登录、私密通信等场景保持人工确认。
OpenDroid 将本地/远程大模型+ 无障碍 UI 自动化 + 自主规划重试机制 缝合在一起,为开发者提供了一个探索“手机端超级助理”的最佳脚手架,是目前 Android 自主 Agent 中值得优先尝试的项目。
Android 智能体技术路线生态
目前”让 LLM 操作手机” 已经形成了几条差异明显的技术路线,按按感知与执行方式分类,可以大致分为:无障碍服务驱动型,ADB/WebDriverAgent 驱动型,纯视觉/多模态驱动型,学术研究/系统级方案。
1. 无障碍服务驱动型
直接读取 Accessibility Service 暴露的 UI 树(或结合截图),不依赖 root 或 ADB,可以直接打包成一个独立 App。
OpenDroid 属于这一类,好处是可以做成”装完就能跑”的终端用户产品,代价是必须常驻一个高权限的系统服务。
2. ADB/WebDriverAgent 驱动型
通过电脑端的调试桥控制手机,不需要在手机上装常驻服务,常见于自动化测试和 QA 场景延伸出来的智能体项目,典型代表包括 Open-AutoGLM、 Mobilerun 和 Ghost in the Droid。
这类方案更贴近”给开发者的自动化框架”而非”给普通用户的手机助手”。
3. 纯视觉/多模态驱动型
不依赖无障碍树,完全靠截图 + 多模态模型判断可点击区域,典型代表是 腾讯的 AppAgent 、阿里的 Mobile-Agent。
这类方案理论上兼容性最好(不挑 App、不需要无障碍树结构良好),但 Token 消耗和成本过高、任务成功率也不一定占优,视觉驱动方案的单任务成本比无障碍树驱动方案高出十几倍。
4. 学术研究/系统级方案
典型代表是清华的 AutoDroid ,这类方案更多面向论文和基准建设,不是拿来即用的终端产品。