1758 字
约 5 分钟
1
信任校准:最好的用户是半信半疑的
无标签

专题篇章 · AI 产品心理学 信任校准:最好的用户是半信半疑的 前四课都在给体验挣分,这一课踩一脚刹车: 信任这个指标,目标值从来就没定在满分 。AI 会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费。这一课先看两笔真实学费,再给你三件能亲手拨弄的校准工具。 一句话速览 全信的把编造判例抄进法庭文书,不信的把 AI 变成摆设。六个场景亲手判断信任状态;可点开的引用、置信度代理信号、有条件的警告 先看两种翻车姿势 全信的出事故,不信的白花钱。 信任校准(Trust Calibration)的奠基综述 Lee & See(2004)把要求说得很清楚:信任要和系统的真实能力对齐。信高了叫误用(misuse),信低了叫弃用(disuse),两头各有各的账单。

⚠ 过度信任:把幻觉当真相用 2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例 原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范, 每一个表面特征都在诱导「它很靠谱」的判断 ,而这些特征和内容真伪互不相干。

⚠ 信任不足:AI 变成昂贵的摆设 另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此 每条输出都逐句复核 ,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。

系统实际的靠谱程度 → 用户以为的靠谱程度 → 过度信任区 · 误用 信任不足区 · 弃用 校准线:信任 = 真实能力

横轴是系统真的有多靠谱,纵轴是用户以为它有多靠谱。产品设计的任务:把落在两个角落里的用户,往对角线上拉。往下的三件工具,拉的都是这根线。

六个用户,逐个把脉 判断口诀先给你:盯着 「风险 × 可核验性」 看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。

这六个用户,信任健康吗 0 / 6

三个选项:过度信任、信任不足、校准良好。先判断,再看解析。

把引用做成能点开的 第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点: 装饰性的假引用被戳穿一次,比没有引用糟糕十倍 。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。

三条引用,揪出对不上的那条 0 / 3 已点开

点角标 [1][2][3] 展开原文卡片,比对回答里那句话和原文说的到底一致吗。

问:试用期第二个月被公司口头辞退,我能主张赔偿吗? 可以主张。用人单位在试用期解除劳动合同,应当向你说明理由 [1] ;如果构成违法解除,赔偿金按经济补偿标准的二倍支付 [2] 。注意别拖:劳动仲裁的申请时效为一年,从被辞退当天起算 [3] 。建议先保留辞退通知、考勤和工资记录等证据。

三条引用里有一条对不上原文,是哪条? [1] [2] [3]

亲手调一版置信度信号 第二件工具:置信度。第一篇章讲过, 模型不知道自己不知道 ,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策, 拨一拨,看右边的回答和用户的信任校准度怎么变 。

置信度信号设计器 拨一拨

回答措辞

笃定断言 带条件限定

来源引用

0 条 3 条可点开

警告条

每条都挂免责 低置信时才出现

用户信任校准度

22

布洛芬和对乙酰氨基酚,发烧能交替吃吗?

[1] 解热镇痛药临床应用指南 [2] 药典 · 非甾体抗炎药 [3] 三甲医院用药问答库

狼来了,连喊五遍试试 第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫 横幅盲视(banner blindness) :Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。

恒定免责 vs 条件警告 第 0 / 5 条

先在「恒定免责组」点满五条,再切「条件警告组」对比。横幅的浓淡模拟的就是用户注意力的钝化。

恒定免责组 条件警告组

下一条回答

用户对警告的注意力

100

出处与延伸: 信任校准的奠基综述是 Lee & See (2004) Trust in Automation: Designing for Appropriate Reliance ,误用(misuse)与弃用(disuse)的提法出自 Parasuraman & Riley (1997);律师抄幻觉判例为真实案件 Mata v. Avianca, Inc. (S.D.N.Y. 2023);横幅盲视见 Benway & Lane (1998) 的眼动研究。信任跌落之后怎么修,第 6 课讲算法厌恶(Dietvorst et al., 2015)时接着说;高危动作的人工闸门,第 7 课防御心理里有完整的设计谱系。

✅ 这一课想和你分享的

把信任目标定在校准 :全信的出事故,不信的白花钱,产品要把用户往对角线上拉 引用做成能点开的 :把「信我」换成「你可以验」,同时提防装饰性假引用反噬 置信度用代理信号说 :检索命中数、相关度、来源一致性,比模型自报的把握诚实 警告有条件地出现 :恒定免责三天就隐形,低置信时带原因弹出才会被读

信任校准:最好的用户是半信半疑的
http://www.clxhxhhr.top/posts/3962/
作者
clxstart
发布于
2026-09-25
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。