arganzheng · 2026-10-05
把 AI 放在边界内、把人放在边界上、把信任校准到与能力一致、诚实呈现不确定、量「有用」而不是「用了」。
%%{init: {"flowchart": {"wrappingWidth": 200}}}%%
flowchart TB
U1["01 场景选择<br/>锯齿状边界、demo–产品鸿沟"] --> U2["02 形态<br/>copilot → agent → 后台 → 自动化"]
U1 & U2 --> U3["03 人机分工与信任校准"]
U3 --> U4["04 不确定性的呈现与非对话形态"]
U2 & U3 & U4 --> U5["05 产品指标与回流<br/>北极星 / 护栏 / 反指标 → 评测集与飞轮"]
结论:四维度(价值、可验证、容错、频率);锯齿状边界按任务划、用评测集量;回撤的共同错误是外推;鸿沟五来源;决策拆任务 → 三分 → 审外推 → 可逆。
%%{init: {"flowchart": {"wrappingWidth": 480}}}%%
flowchart TB
S["一个候选场景"] --> D1{"可验证吗?"}
D1 -- "能自动验证(跑测试、比对答案)" --> D2{"可撤销吗?"}
D1 -- "只能人判断" --> H["人在环内:copilot 形态<br/>(客服的争议处理、法律意见)"]
D2 -- "能回滚(改代码提 PR、写草稿)" --> AUTO["可以自主循环几十步<br/>(coding agent 最先成熟的原因)"]
D2 -- "不可逆(发合同、删数据、驾驶)" --> GATE["每个动作前确认门 / 仿真验证"]
AUTO & H & GATE --> W{"价值 × 频率<br/>值不值得做?"}
W -- "高频 + 单次价值高" --> GO["做"]
W -- "低频 / 价值低" --> NO["不做,或先 demo 验证"]
| 证据 | 数 |
|---|---|
| 哈佛 / BCG 758 名顾问 | 边界内 +25% 速度 / +40% 质量;边界外错误 +19 pp——比不用更差 |
| Klarna | 700 人的工作 → 裁 1,500 → 回到混合;来自简单查询,20–30% 例外漏回成本 |
| 经验 | 「80% 的 demo 是 20% 的产品」 |
结论:四种形态对应人机六级,每往上一级把一类验证从人交给系统;能到哪一级由任务的可验证 / 可撤销决定,不由模型多强决定。
%%{init: {"flowchart": {"wrappingWidth": 520}}}%%
flowchart TB
A["<b>copilot</b>:人在做,AI 在旁边建议(Tab 补全、对话框)——人每一步都看"] --> B["<b>同步 agent</b>:AI 多步执行,人在关键步审批(编辑器内改多个文件、看 diff)"]
B --> C["<b>后台 agent</b>:人提任务、走开、回来审 PR——人只看结果(on the loop)"]
C --> D["<b>自动化</b>:无人在环,只在可验证 + 可回滚的动作上,异常自动降级回环内"]
A -. "往上每一级把一类验证从人交给系统;能到哪一级由任务的可验证 / 可撤销决定,不由模型多强决定" .-> D
| 形态 | 人在哪看结果 | 前提 |
|---|---|---|
| copilot | 逐条 | 无 |
| 同步 agent | 等它做完 | 步数可控 |
| 后台 agent | 落点(PR 是天然审阅落点) | 独立完成、进度通知、部分结果 |
| 自动化 | 不看 | 可验证 + 可逆 |
结论:过度(自动化偏见)与不足两种失败,目标是校准;接受率三成 + 再编辑是常态;八种手段;让不信任的开始用;动态重校。
%%{init: {"flowchart": {"wrappingWidth": 230}}}%%
flowchart TB
X["信任 vs 实际能力"] --> OT["<b>过度信任</b>(信任 > 能力)<br/>自动化偏见:多数时候对,人停止核对<br/>信号:核对率趋零而错误率不为零<br/>案例:Air Canada、虚构判例、PocketOS"]
X --> OK["<b>校准</b>(信任 ≈ 能力):目标<br/>用户在 AI 擅长处放手、在边界外核对"]
X --> UT["<b>信任不足</b>(信任 < 能力)<br/>功能没人用,或每条都重做<br/>信号:采纳率低、修改率接近 100%<br/>价值归零"]
OT -- "「降」:显示不确定、引用可点开、<br/>关键动作强制确认" --> OK
UT -- "「升」:低风险处先试、展示成功率、<br/>让用户看到它怎么做的" --> OK
| 危险信号 | 含义 |
|---|---|
| 接受率趋 100% 而有错 | 过度信任 |
| 核对率趋零 | 自动化偏见 |
| 接受率三成、大量再编辑 | 正常——人在编辑 |
结论:三原则——诚实、可核对、可行动;引用到段落、置信度用行为不用数字、拒答三部分(不能做什么 / 为什么 / 能做什么);步骤分层、审批三要素、diff 部分接受;对话框五局限、七种非对话形态。
%%{init: {"flowchart": {"wrappingWidth": 480}}}%%
flowchart TB
subgraph P1[" "]
direction LR
M1["检索到的块(L3)"] --> U1["引用:点开定位到原文段落,粒度到句子"]
end
subgraph P2[" "]
direction LR
M2["模型的不确定 / 拒答出口(L2)"] --> U2["置信度用行为不用数字:「我不确定」、给两个选项、反问一句"]
end
subgraph P3[" "]
direction LR
M3["agent 的步骤与审批(L4)"] --> U3["步骤流可见、审批带理由与影响范围、diff 式审阅"]
end
subgraph P4[" "]
direction LR
M4["流式输出(L1)"] --> U4["首字 1 秒出现、进度可见"]
end
P1 ~~~ P2 ~~~ P3 ~~~ P4
| 不要 | 要 |
|---|---|
| 「置信度 87%」 | 用行为:加引用、标注「未核实」、请求确认 |
| 「无法回答」 | 三部分拒答 |
| 展开全部步骤 | 分层:结论 → 关键步 → 全部 |
| 允许 / 拒绝两个按钮 | 三要素:做什么、影响什么、怎么撤 |
| 默认对话框 | 先问「为什么是对话框」 |
结论:矩阵十类;北极星一场景一个 + 护栏;反指标(消息数涨可能是重试);自报高于实测一倍以上、两个都报;定性看绕过;回流三条;A/B 五特殊。
%%{init: {"flowchart": {"wrappingWidth": 460}}}%%
flowchart TB
W["周报:消息数 +40%、AI 生成占比 65%、自报每周省 5 小时——三个都可能在说一个正在失败的产品"] --> Q{"量的是「用了」还是「有用」?"}
Q --> N["<b>北极星</b>:用户真正得到的价值,一个场景一个(工单一次解决率、PR 合入率、报告被直接采用的比例)"]
Q --> G["<b>护栏</b>:北极星涨时不能掉的——错误率、核对率不趋零、每任务成本 p95、越权事件、转人工率"]
N & G --> F["<b>反指标</b>:涨了要警惕的——重试次数、消息数暴涨、接受率接近 100%"]
F --> B["回流:坏结果 → 评测集(L5)→ 飞轮(L6 第七篇)"]
| 场景 | 不是北极星 | 是 |
|---|---|---|
| 客服 | 处理时间 | 一次解决率 + 护栏(升级率) |
| 编码 | 接受率、消息数 | 合入且未回退的改动 |
| 写作 | 生成字数 | 保留到发布的比例 |
| 动词 | 篇 | 落点 |
|---|---|---|
| 放在边界内 | 01 | 按任务划边界、评测集量、审外推 |
| 放在边界上 | 02 | 落点、提案、六级分工 |
| 校准 | 03 | 接受 × 错误 × 核对象限 |
| 诚实呈现 | 04 | 三原则、行为不数字、拒答三部分 |
| 量有用 | 05 | 北极星 + 护栏 + 反指标;回流到评测集 |
/ai-product-and-experience.html;通关自测在系列总结