开源手机 Agent 框架推荐:Open-AutoGLM、Mobilerun 与 Minitap mobile-use 怎么选
按设备前提、运行时、模型配置、手机执行、追踪检查、许可证和维护成本比较 Open-AutoGLM、Mobilerun 与 Minitap mobile-use,并说明不想部署框架时的 FoneClaw 路线。
- Open-AutoGLM、Mobilerun 和 Minitap mobile-use 都是真正的开源手机 Agent 框架,但适合的任务不同,不应按没有实测依据的速度或成功率排名。
- 选择前要把框架运行时、模型推理和手机执行分开:开源仓库不等于免费模型调用,也不等于任意手机本地离线运行。
- Mobilerun Framework 与 Mobilerun Cloud 是不同路线;Minitap mobile-use 的 iOS 支持也要按项目设置说明核对,不能当作与 Android 完全等价。
- 不想维护 ADB、设备池、模型端点和追踪系统的读者,可以把 FoneClaw 作为现成 Android 产品路线,但它不是开源框架。
先按任务选择框架
开源手机 Agent 框架推荐,先看你要解决的是研究、自动化开发,还是现成手机任务。如果目标是研究视觉手机 Agent、ADB 控制和模型服务之间的关系,Open-AutoGLM 更适合先看;如果你想用 CLI 或 Python 写可追踪的移动端自动化流程,Mobilerun Framework 更直接;如果你要用自然语言描述结构化移动任务,并关注 Android 设备、模拟器和可抽取结果,Minitap mobile-use 值得评估。
| 选择 | 更适合 | 先确认什么 |
|---|---|---|
| Open-AutoGLM | 视觉手机 Agent 研究、ADB 执行、敏感动作确认 | Android 调试环境、模型端点、自托管或托管推理 |
| Mobilerun Framework | 本机运行 Agent、CLI/Python 控制、轨迹与追踪 | Portal 辅助服务、ADB、模型提供商、追踪系统 |
| Mobilerun Cloud | 需要托管设备、API 工作流或云端设备池 | 云服务依赖、成本、数据路径和设备类型 |
| Minitap mobile-use | 自然语言移动 UI 自动化、结构化抽取、Android 快速试验 | ADB、模型提供商、iOS 模拟器限制和项目许可证 |
选择时优先看任务适配度:目标设备能否连接、执行层是否可检查、模型路线是否可承担、失败后是否能定位和恢复。
比较设备、执行、模型和许可证
三个项目都把“手机 Agent”拆成几层:框架运行时负责组织任务,模型负责理解和规划,手机执行层负责点击、输入、观察和回传结果。不要把这几层混成一个能力承诺。一个仓库开源,不代表模型调用免费、云手机免费、推理全在本地,也不代表所有 App 都能稳定完成任务。
| 项目 | 设备与执行 | 模型路线 | 检查与许可证 |
|---|---|---|---|
| Open-AutoGLM | Android 通过 ADB 控制,文档也提到 HarmonyOS 的 HDC;iOS 走单独 WebDriverAgent 设置 | 可接第三方托管模型 API,也可自托管推理服务 | 说明敏感操作确认和登录、验证码人工接管;仓库为 Apache-2.0 |
| Mobilerun Framework | 本机运行 Agent,使用 ADB、开发者选项和 Portal 辅助服务;iOS 有独立 Portal 设置 | 支持选择模型提供商,本机运行框架不等于本地推理 | 支持 Arize Phoenix、Langfuse 与轨迹保存;仓库为 MIT |
| Minitap mobile-use | Android 真机或模拟器经 ADB;Docker 快速开始面向 Android | 可配置 LLM 提供商,支持结构化抽取 | README 说明游戏等缺少无障碍树信息的场景有限制;仓库为 Apache-2.0 |
如果你的核心问题是模型怎么选,可以先看AI 智能体模型推荐:按手机任务选择工具调用模型与 GUI 模型;如果核心问题是执行是否可靠,则要回到设备与任务本身。
什么时候选 Open-AutoGLM
Open-AutoGLM 官方仓库适合需要理解“视觉模型、手机屏幕、ADB 动作和人工确认”如何组合的团队。它的 Android 路线涉及开发者模式、USB 调试、ADB Keyboard 等准备;框架可以使用托管模型服务,也可以连接自建推理服务,因此本地 GPU 不是托管 API 路线的前提。
它的优势是把手机 GUI Agent 的关键环节摆得比较清楚:屏幕观察、动作生成、设备执行、敏感操作确认,以及登录或验证码场景下的人类接管。适合研究、评估和构建自己的执行链路。边界也要讲清:Apache-2.0 是仓库许可证,不自动覆盖模型、数据、设备、依赖和服务条款;官方说明里的能力也不是任意 App 的成功保证。
什么时候选 Mobilerun Framework 或 Cloud
Mobilerun 官方仓库适合想用命令行或 Python 组织移动端任务的开发者。它提供移动控制、无障碍树、截图、模型提供商选择和结构化结果;Android 准备包括 ADB、开发者/USB 调试以及 Portal 辅助服务。它还保留了从 DroidRun 更名而来的线索,但选择时应以当前 Mobilerun 仓库为准。
要特别区分 Mobilerun Framework 和 Mobilerun Cloud。Framework 是在你的机器上运行 Agent,并不证明模型推理也在本机;Cloud 则面向连接本地手机、托管虚拟或物理手机、API 工作流等托管场景,运维依赖、成本和数据路径都不同。Mobilerun 还记录了 Arize Phoenix、Langfuse 和轨迹保存,适合需要检查失败原因、回放执行过程和比较不同模型行为的团队。
什么时候选 Minitap mobile-use
Minitap mobile-use 官方仓库更适合希望用自然语言描述移动 UI 任务,并拿到结构化抽取结果的场景。它支持配置 LLM 提供商,Android 真机和模拟器通过 ADB 连接,Docker 快速开始也明确面向 Android。对想快速构建“打开应用、读取界面、完成可回退任务、抽取结果”的团队,这条路线比从头写设备控制层更省力。
iOS 支持要按项目设置说明看,不要被泛化表述带偏。mobile-use 的 README 在手动设备部分列出 macOS 上的 iOS 模拟器,同时明确说明物理 iOS 设备尚不支持。它也提示游戏等缺少无障碍树信息的场景会受限。因此,采用前要把目标设备、目标 App、无障碍树可见性和模型服务一起验证。
用可回退任务检查失败点
评估开源手机智能体开发框架时,不要从付款、删除、发消息这类高风险动作开始。先选一个可回退任务,例如打开设置页读取状态、在便签里创建一条测试文本、进入日历准备但不提交一个事项,或在测试网页中完成表单草稿。每个框架都用同一设备、同一模型路线、同一网络和同一任务描述。
- 记录设备准备:ADB 或 Portal 是否稳定,截图、无障碍树和输入法是否可用。
- 记录模型路径:托管 API、自托管服务、密钥、上下文长度和费用条件。
- 检查执行轨迹:每一步看到什么、选择什么、参数从哪里来。
- 制造失败:撤销权限、切换页面、断开设备或改变 UI 状态。
- 看恢复方式:是否停下解释、是否请求人工接管、是否避免继续使用旧信息。
- 最后核对结果:目标 App 中是否出现正确状态,失败是否有可定位原因。
这只是评估计划,不是我们替你跑出的结论。想把任务设计、记录表和风险恢复做得更系统,可以继续读安卓手机 Agent 基准测试指南:2026 年怎样评估可靠性、安全和恢复。涉及真实手机控制边界时,AI 智能体控制 Android 手机:从自然语言意图到确认、执行和验证会帮助你把意图、确认和结果分开。
不想部署框架时的 Android 路线
如果你的目标不是开发框架,而是让 Android 手机完成日常受支持任务,FoneClaw 是另一条路线。它不是开源手机 Agent 框架;它是面向 Android 用户的现成应用,提供默认模型路线,也允许在条件满足时配置兼容模型,并通过受治理的工具处理手机任务。
这条路线适合不想维护 ADB、云设备、推理服务、追踪系统和执行器的人。FoneClaw 可以打开应用、读取受支持的信息、整理 SMS、创建待办,并在需要权限和审批的地方保持可见;但手机侧运行不等于所有推理都在本机,也不表示所有动作都能无人值守完成。当前能力范围可以从FoneClaw 功能页面了解;如果你想讨论框架评估和现成产品路线的取舍,也可以联系我们。