DOC · RICK1← 返回文档列表
GUI MODEL · FINE-TUNING

百炼 GUI 模型微调选型

除了 Qwen3-VL-8B-Instruct,还可以怎样选?围绕截图理解、动作输出与任务执行,选择适合自己的第一轮实验。

核对日期 2026-09-30百炼 · 华北 2(北京)公开资料与工程建议

优先考虑 4B 入门、32B 做第二阶段对照

目标是将截图与历史操作转换为下一步 GUI 动作,并在百炼完成托管微调。Qwen3-VL-8B-Instruct 仍可作为首轮基线;其他候选中,优先关注以下两款。

先验证流程

Qwen3-VL-4B-Instruct

以较低训练成本验证数据格式、动作协议、坐标转换和真实执行闭环。

再检验更大模型的收益

Qwen2.5-VL-32B-Instruct

使用同一批数据和测试任务,判断更大模型是否改善复杂界面与多步骤任务。

以上为工程选型建议,尚未进行这些模型在同一 GUI 测试集上的实测。参数量接近某个现有模型,不代表基座、训练配方或任务能力相同。

平台事实 + 选型判断

明确支持视觉 SFT 的候选

下表模型均在百炼北京地域的视觉调优支持名单中,支持 SFT 全参训练及高效训练(LoRA)。用途栏为建议;能力高低需要实测。

模型建议用途与优先级训练价 / 百万 Token
Qwen3-VL-4B-Instruct低预算入门
先把截图、标注、训练、动作执行和评测链路跑通。
¥6
Qwen3-VL-8B-Instruct首轮基线。已有该模型的实验时,保留它用于同数据对比。¥12
Qwen2.5-VL-32B-Instruct第二阶段候选
验证更大模型在实际复杂 GUI 任务中的收益。
¥20
Qwen3-VL-8B-Thinking用于复杂决策实验;第一轮以低延迟动作执行为目标时,优先采用 Instruct 基线。¥12
Qwen2.5-VL-7B-Instruct适合已有该系列数据和部署经验的项目;从零开始仍优先试 Qwen3-VL-8B。¥10
Qwen2.5-VL-72B-Instruct预算充足时做大模型对照,首轮优先级较低。¥50

价格为官方每千 Token 单价换算,不是 API 推理价格。来源:百炼模型调优简介与计费。本文只列已明确归入视觉微调名单的候选,不覆盖所有可调用模型;能通过 API 看图不等于已确认可在该入口进行图片微调。

实施建议

让评测决定是否升级

01

4B / 8B 跑通闭环

核对截图输入、动作格式、坐标映射和执行结果。保留未微调基座,观察训练是否真正带来收益。

02

32B 做同任务对照

固定测试任务与数据划分,比较点击命中率、完整任务成功率、单步延迟和每个成功任务的成本。

03

按失败原因再选型

复杂决策成为主要瓶颈时,再试 Thinking;截图模糊、坐标错位或标注错误,优先修数据与执行链路。

同一条完整任务轨迹应归入同一数据集合,避免相邻截图跨训练集和测试集造成结果虚高。更大参数量、更新版本或更低训练损失,都不能替代完整任务评测。

假设算例

先估算训练费,再核对部署成本

假设每个模型单轮计费数据量均为 2,000 万 Token,训练 2 轮,不额外加入混合训练数据:

训练费 = 单轮计费 Token 总量 × 训练轮数 × 对应模型训练单价
¥240Qwen3-VL-4B-Instruct
¥480Qwen3-VL-8B-Instruct
¥800Qwen2.5-VL-32B-Instruct

截图转换后的视觉 Token 也需要计入,不能仅按文字或样本条数估算。同一批图片在不同模型下的实际 Token 数可能不同;开启混合训练时,还要计入混合数据量。

以上仅为训练费,不含数据标注、评测、部署与推理。VL 模型按 Token 计费要求 freeze_vit=true,即冻结视觉主干;提交前以控制台预估为准。来源:模型调优操作与参数说明。

现成 GUI 能力对照

GUI-Owl:适合对照现成效果

百炼通义 UI Agent 提供基于终端截图理解和操作的接口,适合加入评测,观察通用视觉基座与现成 GUI 能力之间的差距。

官方接口示例使用 app_id=gui-owl,但本次核对的标准视觉微调名单中未见 GUI-Owl。因此,应将它视为可调用的 GUI 方案,而不能直接认定它已经支持百炼自助微调。

来源:通义 UI Agent 官方接口。接入时需核对账号可用性及其动作返回协议。

官方来源与适用范围

  1. 模型调优简介:北京地域、视觉模型名单、SFT / LoRA 支持、训练计费公式及单价。
  2. 模型调优操作:训练参数,以及冻结视觉主干与按 Token 计费的关系。
  3. 通义 UI Agent:截图操作方案与 GUI-Owl 接口。

资料核对日期:2026-09-30。模型支持范围、价格和账号开放情况可能变化;正式提交训练前再次核对控制台。推荐顺序属于工程判断,本文未声称某款模型在你的实际任务上已经胜出。