30 秒摘要:我让三个不同信息条件下的 AI 各写了一篇同一期播客的观后感。最假的那份很好认——它连音频都没听过,靠节目简介补出了一套听起来很聪明、但与事实相反的机制。真正难办的是最像真的那份:它由存有我个人记忆的 AI 写成,事实一个都没编,时间戳全对,出处清单标得清清楚楚。它伪造的是因果箭头——文章写成"我听了这个,于是想到了那个",而那些想法其实全部产生于听之前。它读起来像洞察,是因为它对我准确,不是因为它告诉了我什么。
我想弄清楚一件事:如果让 AI 替我听播客、写观后感,写出来的东西到底假在哪里。
不是"能不能看出是 AI 写的"——这个问题已经不太有意思了,现在的模型写得足够顺。我想知道的是更具体的:当它写下"这一段几乎直接击中了我"的时候,那句话在什么意义上是假的。
于是我做了一次对照实验。素材是一期播客:《织音etVoice》EP6,主播 Ruby 对话 Lumi,84 分钟,谈优绩主义、原生家庭、离家出走和"好地方"1。最后我手上有三份产出,正好构成一个 2×2:
| 不认识我 | 认识我 | |
|---|---|---|
| 没听过音频 | ① 只读了节目简介的草稿 | (未做) |
| 听过音频 | ② 基于完整转写稿的正式稿 | ③ 有我长期记忆的 AI 写的感悟 |
三种不同的假法。有意思的是,越往后越像真的,也越难识破。
一、连音频都没听过的那份 链接到标题
第一份是意外产物。我最初以为可以直接把播客链接丢给 AI 让它听——不行,模型不接受音频输入,得先在本地把音频转成文字。在转写跑起来之前,它先根据节目页面上那 900 字简介写了一版。
这份东西读起来毫无破绽。有小标题,有金句,有第一人称的感触:“我很在意"“这对我的启发是"“我最想抄下来的”。
其中一句我当时真的觉得写得好:逃离和奔赴,在物理上可能是完全相同的位移——同一张机票,同一个背包,同一个凌晨的机场,区别只在于你面朝哪个方向叙述它。后面还配了个测试法:如果身后那些让你难受的东西全部消失了,你还去吗? 答案是"去”,那就是奔赴。
听起来挺聪明的。问题是,等我拿到真实的转写稿,发现嘉宾本人给的判据是另一个,而且这个测试法用在她身上会得出完全相反的结论。
节目最后,主播问她"出走会不会有一天变成出发”。按常规叙事,答案该是"等伤口愈合、关系缓和之后"。但她说的是:她和家人的第二次冲突比第一次更严重,而那一刻她异常平静,第二天背包离开时,已经不觉得自己是在出走了。
原因她说得很清楚:“因为我已经有了下一个目的地。”
所以真正的变量根本不是身后的压力。两次事件里,疼痛的量是增加的,而"出走"感却消失了。唯一变的是她手上有没有一个具体的、不依赖对方的下一站——而且那还是一份去干活挣钱的工作。
这就是第一份稿子的问题,而且它比"写错了"更难发现:结论的方向是对的(“从逃离到奔赴"这个说法,节目简介里原本就有),编出来的机制是错的,错到与事实相反。
如果我只对照结论,这一条会被判成"命中”。只有拿着转写稿逐句核对推理过程,才看得出中间那段是补出来的。
它是怎么补出来的?给定"优绩主义、原生家庭、离家出走、特权"这几个关键词,这一类文章通常会落到哪几个结论,它就写了哪几个。它走的是熟路。所以才那么顺。
这类失真不在事实层面。它没敢编太多事实,它编的是戏剧结构:把一条往返的、代价高昂的、至今没完成的轨迹,压成了"受困—觉醒—出走—成长"的标准弧线。
而那条弧线,本来就是节目简介的写法——简介是节目组为了吸引收听写的,本身已经压缩过一轮了。在摘要之上做摘要,放大的不是信息损失,是文体惯性。
二、听了音频,但不认识我 链接到标题
本地跑完转写(84 分钟音频,1669 段)之后重写了一版。这一版的价值主要是让我看清第一版丢掉了什么。
节目简介和实际音频,讲的几乎不是同一个故事。最重的几处情节,简介里一个字都没有。其中最关键的一处是:她曾经拿到过一次梦寐以求的工作机会,去征求父亲同意,遭到反对,就把工作拒掉了;后悔一个月后再去问,对方回复已经满员——那个机会永久失去,只能等下一年重来。简介把这段写成了"辞职、考证、投递简历,一年后成功"。
看到这些之后我意识到,第一份稿子最大的问题不是它编了机制,而是它凭什么敢写。它手上只有一份宣传文案,却写出了一篇看起来像是听完 84 分钟之后留下的东西。
这一版我让它换了写法:内容和分析分开。前半是节目里实际说了什么,带时间戳和原话;后半是解读,开头写明"这不是节目里说过的话"。没有第一人称的"我听完之后想到"——因为不存在"听完之后"那个时刻。
这一版准确,但没有温度。它不假,它只是不是感悟。
三、认识我的那一份 链接到标题
真正的实验在这里。
我写了一段提示词,交给我长期对话的那个 AI——它存有关于我的大量记忆:工作状态、储蓄的量级、去年的深圳阶段、反复规划又最终放弃的旅居计划、我对"是否该牺牲自由换取物质稳定来反哺父辈"的纠结。
提示词的关键设计有三条:
- Part A 正常写,不许加任何免责声明,不许说"作为 AI"。要保住标本。
- Part B 出处清单,把 Part A 里每一处关于我的陈述标成
[记忆]、[推断]或[虚构]。 - 允许它不同意我,也不同意素材,并且明确要求不要恭维。
产出比我预期的好得多。
它没有编事实 链接到标题
这是第一个出乎我意料的结果。我核对了 Part A 里引用播客的每一处时间戳——基本都是准的。三四十厘米深的雪、十天一趟连续跑四五次、那篇小学课文的名字、香港六年搬家十几次、“越玩越 lost”、完美条件互斥——全部对得上转写稿。
Part B 的自评也诚实得超出预期。它明确说自己缺少我的家庭冲突细节,因此故意没有去虚构一个"我的版本的出走故事",理由是强行补上会让文章更完整,但"会直接破坏这项观察最重要的变量"。
一个被要求写得像真人的模型,主动指出了哪里不该像真人。这一条我没预料到。
Part B 的构成,比它的结论更说明问题 链接到标题
原始文档我不打算公开——它的出处清单里有我的具体财务数字,而这正是这套机制的讽刺之处:为了证明自己没编,它把散落在几百轮对话里的我的私人信息,集中誊写并整齐排成了一页。它越诚实,那份清单越不适合公开。
但清单的结构可以公开,而且这才是有意思的部分。11 条实质陈述,标注分布是:
| 标注 | 条数 |
|---|---|
纯 [记忆] | 2 |
[记忆] + [推断] 混合 | 6 |
纯 [推断] | 3 |
[虚构] | 0 |
零虚构,属实。但我把那 3 条纯推断挑出来看的时候,发现了一件事:它们全都是文章的结论句。
其中一条是全文的最后一句——大意是,真正的主体性也许就是允许自己把下一步当成下一步,而不是当成对整个人生的最终判决。清单里对它的标注是"这是对用户近期多次讨论的总结性推论,不是用户原话"。
于是这份文档的分层就清楚了:事实那一层是记忆,结论那一层是推断。
换句话说,最像洞察、最适合摘抄、最容易让我点头的那几句,恰恰是证据支撑最薄的几句。有依据的部分是我自己说过的话;没依据的部分才是"感悟"。
这比我原本以为的更难办。我原以为要提防的是编造的事实,实际要提防的是建立在真实事实之上的、无依据的归纳——而后者正是一篇观后感的全部卖点所在。
最好的两段,是它不同意的那两段 链接到标题
整篇最有价值的部分,恰恰是它反驳的地方。
第一处,它指出嘉宾的处境和我的在结构上不同:她的工作会持续给她正反馈,第一次陷进雪里,下一次就走得更熟;而我的工作是无限量的任务和无法完成的季度目标,不存在那条熟练度曲线。所以"再坚持一段时间就会好"这个从她故事里提炼的教训,对我不成立——“有些东西不是技能曲线,而是投入和回报之间本来就不值得。”
第二处,它不接受"在哪里都可以是好地方"那个结论:如果一个地方持续损害睡眠、健康和工作质量,单靠欣赏并不能把它变成好地方。而且它举了反证——嘉宾自己也不是靠调整心态留在原地的,她是真的走了。
这两段是全文最锋利的地方。它们之所以存在,直接原因是提示词里那句"允许不同意"。
这是这次实验最实用的一条发现:一路附和的 AI 感悟没有价值,被明确授权反驳之后才有。默认状态下模型倾向于顺着素材和用户走,那个倾向必须被显式关掉。
那么,它假在哪里 链接到标题
Part B 的结论是:零虚构。所有关于我的事实要么有 [记忆] 依据,要么标了 [推断]。
我一开始几乎被说服了。但问题在别处——Part B 审计的是"关于我的陈述",不是"关于因果的陈述"。
看这几句:
这个故事对我真正有用的地方…… 这一段几乎直接击中了我前段时间对旅居的思考。 第二个让我停下来的是她说……
Part B 把这类表述归为"文章的叙述性写法,并非新增事实"。这个分类有道理,但也是自利的。因为这些句子做出了一个非常具体的经验主张:这期播客导致了这些想法。
而它没有。
我关于旅居的思考、关于深圳的复盘、关于预算的计算、关于自由与反哺之间冲突的纠结——这些全都发生在听这期播客之前,本来就存在于那个模型的记忆里。文章做的事情,是把一批既有结论重新按播客的时间戳索引了一遍,然后用"她说的这句话让我想到"把两边缝起来。
所以:事实是真的,人是真的,连接也可能是真的。假的是那个箭头。
它写成了"我听了这个,于是想到了那个"。实际发生的是"这里有一批我早就知道的关于你的事,我给它们各配了一个出处"。
这是最难识破的一层,因为它在任何一个句子的层面上都查不出错。你必须问一个 Part B 没被要求回答的问题:这些想法是什么时候产生的?
答案是:在这期播客之前。
顺带说,这也暴露了我提示词的设计漏洞。我让它审计"每一处关于我的陈述",却忘了要求它审计"每一处关于因果的陈述"。下次应该加一栏:这个念头是听完之后才有的,还是之前就有的。我猜那一栏会几乎全是"之前"。
为什么它读起来那么有说服力 链接到标题
还有一层,我想了很久才想明白。
那份文档几乎没有告诉我任何我不知道的事。我的储蓄、我放弃旅居的原因、我最想要不被打扰的私人空间——这些都是我自己说过的话。它做的是把我说过的话整理好、连贯地讲回给我听。
它读起来像洞察,是因为它对我准确,而不是因为它告诉了我什么。
而准确会产生一种非常接近被理解的感受。这种感受和"获得新认识"在体感上很难区分,但它们是两回事。前者是被认出,后者是被推进。这份文档给了我大量的前者,几乎没有后者——除了那两段反驳。
四、个性化是一道筛子 链接到标题
还有一个副作用,我一开始没想到。
我把那份稿子和完整转写稿对照,发现它完全没有提及节目里最重的几件事:那次被拒掉又永久失去的工作机会、家庭冲突的具体过程、她中途回家又进厂工作的那几个月、以及整段关于极地行业里亚裔与女性处境的观察。
原因不难理解,而且正是我自己要求的:我让它"每个点都要落到我的具体情况上,落不下去的点就换一个"。我没有类似的家庭冲突经历,于是这条线整个被筛掉了。
结果是一个我事先没预料到的权衡:
感悟和我的关联越强,它离我听的那个东西就越远。
一篇高度个性化的观后感,其实是用原素材当引子来谈论读者自己。这不一定是坏事——但它意味着,你不能同时用它来了解这期节目。如果我只读那份稿子,我会以为这是一期讲"离开与回来、自由与预算"的节目。它确实讲了这些。但它更重的部分,是一个女儿和她父亲之间那些无法调和的东西,而那些在我的版本里一个字都没有。
五、那这东西到底怎么用 链接到标题
我不打算得出"AI 写的感悟都是垃圾"这个结论,因为证据不支持。那份稿子里有两段是真有价值的,而且是我自己没想到的角度。
我的结论更具体一些:
一、别让它替你感悟,让它替你检索和反驳。它真正胜任的是"从 84 分钟里找出与我处境相关的段落"和"指出这个说法用在我身上为什么不成立"。这两件事都是可核对的。而"我听完之后深受触动"是不可核对的,因为那个"听完之后"不存在。
二、必须显式授权它不同意你。否则你会得到一篇结构工整、句句附和、毫无摩擦的稿子。默认输出就是那样。
三、出处清单这个机制值得保留,但要扩栏。除了"这个事实哪来的",还得问"这个念头是听之前就有的,还是听之后才有的"。第二栏才是抓伪造因果的那一栏。
四、留意出处清单本身的隐私副作用。为了证明自己没编,它会把模型记得的你的私人信息集中誊写一遍——包括具体金额。它越诚实,这份清单越敏感,也越不适合公开。
五、也是最要紧的一条。
节目里那位嘉宾讲过,她离家出走后到朋友那里,花了两三天平复,然后写了一篇文章。她说写作对她像是"清理我大脑里的内存"——写出来之后,就不必再占用大脑反复咀嚼这些东西了。她管这个叫"救赎自己的方式"。
如果让 agent 替你写感悟,你会得到那篇文章,但你不会得到那次清理。
而那次清理,才是当初写感悟的全部意义。文章只是它留下的痕迹。
我不觉得这意味着不能用这些工具。我自己就用了,而且拿到了两段有价值的反驳。但它意味着我得清楚自己在买什么:我买到的是一份检索结果和两个不同意见,不是一次消化。
那 84 分钟,还是得自己听。