规划指南 · 2026-09-10 核价

三种能力,
数据与成本怎么准备?

SFT 用合格示范调整模型行为。固定前缀较简单;自定义组件需要组合与渲染验证;办公 CLI 需要可执行、可追溯的完整任务轨迹。数据验证通常比训练 token 更贵。

先把边界说清:下列条数、平均长度、日产能与搭建周期都是预算假设,不是行业统计或“稳定学会”的门槛。较强底座暂按较少数据规划,大模型少用数据不是定律;最终由独立评测决定。
01 / 一条数据到底是什么

按完整示范计数,不按片段凑数

数量指最终合格训练集;验证集与测试集另留、另预算。平均 token 包含训练时输入、输出及必要工具返回,不只是用户短问题。

场景 A · 固定行为

每次回答带固定前缀

覆盖问答、拒答、长短回答与多轮,不能只复制同一句话。

300 token / 完整示范
8B 200
较强底座 100

验收:前缀精确匹配;正文仍正确;恶意要求去前缀时不偏离。

看一条示意数据

教学缩略示意,不代表实际 300 token 长度。

用户:请说明会议纪要包含什么。
助手:[工作助手] 会议纪要应记录议题、结论、行动项、负责人和截止日期。
场景 B · 结构化产物

用 30 个自定义 XML 组件

一条是可渲染的完整页面。覆盖属性、嵌套、数据绑定、组件组合与异常输入。

2,000 token / 完整产物
8B 3,000
较强底座 2,000

验收:组件白名单、类型与引用合法;可渲染;布局和语义满足需求。

看一条示意数据

以下 XML 标签纯属教学示意,并非真实 SDK;完整数据应包含全部页面。

用户:做一张显示待办数量为 8 的卡片。
助手:
<DemoPage>
  <DemoCard title="待办">
    <DemoMetric value="8" />
  </DemoCard>
</DemoPage>
场景 C · 工具执行

多域办公 CLI 完成任务

一条是用户任务→调用→真实返回→后续决策→最终答复。覆盖日历、文档、表格与消息。

4,000 token / 完整轨迹
8B 10,000
较强底座 5,000

验收:命令、参数与依赖正确;权限、分页、失败恢复和写后回读有覆盖。

看一条轨迹结构

伪命令与占位符仅说明结构;本页没有执行办公任务,也没有捏造执行结果。

用户:列出明天的会议。
助手调用:demo-office calendar list
  --date <已解析的日期>
工具返回:<填入沙箱真实执行返回>
助手答复:<仅依据真实返回汇总>

此占位示例不合格、不能直接入库;需实际执行并补齐返回。

训练要贴近最终使用方式:生成阶段可给教师完整规范;若目标是内化组件用法,训练示范应以短任务输入、完整长输出为主,并在不附完整规范的独立测试中验收。一直携带长规范训练,不能证明已经内化。动态 schema、权限与新工具仍应按需提供。
02 / 只算一次训练任务

两轮训练,费用从几元到万元

按阿里云百炼公开训练单价估算,混合训练数据假设为 0,循环次数统一为 2。8B 用上面的 8B 条数,其余已报价模型用“较强底座”条数。

训练费 = 合格条数 × 平均 token / 条 × 2 轮 ÷ 1,000 × 单价

金额:人民币;单价:元 / 千 token
模型单价前缀XMLCLI
Qwen3-8B0.006¥0.72¥72¥480
Qwen3-32B0.04¥2.4¥320¥1,600
Qwen2.5-72B-Instruct0.15¥9¥1,200¥6,000
qwen3.5-plus-2026-02-150.3¥18¥2,400¥12,000
Qwen Max
DS V4Flash

Plus / Max 是产品名称,不是参数规模;不能据此写成某个 B 数。Max 与 DS V4Flash 本次无可核实训练报价,留空不等于免费。

训练表不是项目总价。未包含数据人力、教师生成、重试、judge、独立评测、调参重训、模型部署与推理。公开报价不保证当前账号可创建新训练任务;本次未验证账号资格,也未发起任何收费训练。
03 / 数据生产才是大头

先估合格日产,再换算人日与人工费

1 人日 = 8 小时;示例综合人日成本 = ¥1,000。下面是透明的规划假设,不是外包报价。纯人工日产已包括撰写、验证与返工;合成日产是成熟流水线下团队归一到每人日的合格产出,不代表逐条人工审核

场景纯人工
条 / 人日
合成 + 校验 + 抽检
条 / 人日
一次准备 / 搭建
人日
固定前缀200–4001,000–3,0000.5–1
XML20–40100–3003–7
CLI 完整轨迹10–2050–1505–15

为保守、同口径比较,两种路径均加一次准备 / 搭建预算:人工路径用于规范、验收模板与验证接入,合成路径用于流水线接入。假设渲染器、沙箱和接口现成;如需新开发,另算。既有流水线复用时可扣除已完成的一次性工作。

最少人日 = 条数 ÷ 较高日产 + 最少搭建
最多人日 = 条数 ÷ 较低日产 + 最多搭建
人工费 = 人日 × ¥1,000

区间向外取整:人日保留两位,费用取整到元;费用按未舍入人日计算。人日是总投入,不是日历天数,多人并行不保证线性缩短。

固定前缀

8B · 200 条

纯人工1–2 人日¥1,000–2,000
合成流水线0.56–1.2 人日¥566–1,200

较强底座 · 100 条

纯人工0.75–1.5 人日¥750–1,500
合成流水线0.53–1.1 人日¥533–1,100

30 个 XML 组件

8B · 3,000 条

纯人工78–157 人日¥78,000–157,000
合成流水线13–37 人日¥13,000–37,000

较强底座 · 2,000 条

纯人工53–107 人日¥53,000–107,000
合成流水线9.66–27 人日¥9,666–27,000

多域办公 CLI

8B · 10,000 条

纯人工505–1,015 人日¥505,000–1,015,000
合成流水线71.66–215 人日¥71,666–215,000

较强底座 · 5,000 条

纯人工255–515 人日¥255,000–515,000
合成流水线38.33–115 人日¥38,333–115,000
教师 / API 费:未计入,不能填成 ¥0。
合成费 = Σ(生成 + 重试 + judge 各次调用的输入 token × 对应输入单价 + 输出 token × 对应输出单价)。单价若按百万 token 报价,先除以 1,000,000。分别记录教师模型、缓存、视觉评估与实际账单;生成量应按合格率倒推,不能只乘最终入库条数。
04 / 合成数据需要哪些能力

有生成器,也要有可验证的生产线

  1. 组件规范 / 技能

    整理 30 组件 schema、示例、版本与限制;办公 CLI 的参数、权限、返回格式和技能说明可检索。

  2. 教师生成

    按覆盖矩阵采样任务与组合,输出完整产物;识别缺参、冲突与越权,能澄清或拒绝。

  3. 解析 / 沙箱执行

    XML 解析、类型检查、真实渲染;CLI 在隔离环境执行,保留返回、错误及写后回读。

  4. 语义 / 视觉评估

    自动断言任务是否完成;页面截图检查布局与内容;judge 有人工金标校准,不能只看语法通过。

  5. 去重 / 划分

    按任务模板、实体与组合分组去重;再划分训练、验证、测试,阻止同源改写泄漏。

  6. 抽检 / 入库

    按风险分层抽检,跟踪合格率、失败原因和来源;高风险写操作提高人工审核强度。

每个场景的合格标准

  • 前缀:规则可机械检测,仍需抽检正文质量与跨轮次一致性。
  • XML:语法合法不代表页面正确;必须具备组件渲染器、快照与需求断言。
  • CLI:需要安全沙箱、可重置测试数据、可执行工具、日志与结果核验能力。

两条不可省的边界

  • 未执行,不能伪造轨迹。教师预测的工具返回不算执行证据;可明确标为模拟数据,但不能冒充真实返回入库。
  • 写操作只在沙箱。消息发送、记录更新、日历变更使用测试对象,不能产生真实业务副作用。
  • 先测后扩。用冻结测试集比较原模型与微调模型的任务成功率、格式、渲染与执行结果;失败先补覆盖和验证,不盲目加量。
证据与适用范围

参考能支持什么,不能支持什么

  1. 阿里云百炼:模型训练与部署计费。2026-09-10 核对四个指定型号的训练单价与公式;实际 tokenizer、混合数据、地区 / 模式与账单优先。
  2. OpenAI:Supervised fine-tuning。指南提到 50–100 条可见改善、建议先做 50 条并评测;这不是所有任务的数据门槛,也不是本页三场景的稳定保证。当前页面还提示微调平台对新用户不再开放;此处只引用数据方法。
  3. LIMA(2023):65B LLaMA 使用 1,000 条精选示范;不能推导 8B 用相同数量就能学会自定义 XML 或复杂工具工作流。
  4. APIGen(2024):发布 60,000 条函数调用数据,强调验证与执行;并非证明可以免 schema,也不等同于本页的多域完整办公轨迹。

资料访问:2026-09-10。除明确引用的价格与研究事实外,条数、长度、日产、搭建与人力费均为本页规划假设。未运行训练、未调用付费教师模型。