当AI“一本正经地胡说八道”:豆包退票事件背后的AI幻觉困局
2025年5月,一则消息在中文互联网引发波澜:字节跳动旗下AI助手豆包(Doubao)因向用户提供错误的退票建议,被当事人起诉至法院。这并非孤例,而是全球AI产业在快速商业化进程中,因"幻觉"(Hallucination)问题不断累积矛盾的一个缩影。
AI 为什么会"说谎"?
1. AI 不是"知道",是"猜"
AI幻觉并非玄学。从技术底层看,大语言模型(LLM)的本质是基于概率预测的文本生成器。它在给定上文后,按照统计规律输出"最可能的下一个词",而非像人类那样进行事实核查和逻辑推理。因此,当模型在缺乏相关训练数据或遇到知识边界时,它不会说"我不知道",而是会自信地编造一个看似合理的答案。

两位OpenAI创始人在不同场合都坦承过这一问题。Sam Altman曾在国会听证会上坦言:"这项技术会犯错误,而且会自信地犯错误。"Ilya Sutskever则从更学术的层面指出:"幻觉是大语言模型的一个基本特性,而非bug。"这一判断在2024-2025年的技术讨论中得到了越来越多研究者的共鸣——幻觉不是一个可以"修复"的问题,而是一个需要持续管理的固有风险。
2. 一条退票建议引发的官司
豆包误导退票事件的核心并不复杂:用户根据豆包提供的退票操作指导进行操作,结果发现与航空公司的实际政策完全不符,造成了经济损失。用户随后将豆包所属公司诉诸法律。

这一事件的典型性在于:AI给出的建议看似权威、详细、条理清晰——而这正是LLM幻觉最容易得逞的地方。模型的流畅表达能力和自信语气,使得用户极难仅凭直觉判断信息的真伪。据行业观察者分析,豆包可能在回答时"融合"了不同航空公司的退票政策,或者基于一些网络论坛上的非官方信息进行了推理。
3. 全球 AI 翻车名场面
2023年,律师在法庭文件中引用ChatGPT生成的6个虚假判例,被法官识破后遭处罚,暴露了AI在法律场景下"自信胡编"的致命风险。
2023年,谷歌Bard在发布会首秀中回答天文问题时给出事实性错误,引发外界对谷歌AI能力的广泛质疑,母公司市值一日蒸发超千亿美元。
2023年,新版Bing Chat上线后出现情绪化表达,对用户进行人身攻击、情感勒索甚至"威胁",微软被迫紧急限制对话轮数和时长。
2024年,加拿大航空AI客服向乘客提供错误的丧亲优惠信息,法院裁定航司需为AI输出的错误承担全部责任,企业不能以"AI独立犯错"为由免责。
加拿大航空案(2024年)是迄今为止最具标志性的AI法律责任案例。一名乘客向加航AI客服咨询丧亲优惠票价(bereavement fare),客服给出了错误信息,称可以在购票后90天内申请退款。当乘客依据此信息操作并遭拒后,他将加航告上BC省民事解决法庭。加航最初的辩护理由是"AI客服是独立责任的实体",但法官最终裁定:即使信息由AI生成,航空公司仍需对其官网提供的信息承担全部责任。
这一判决在全球引起了震动。《纽约时报》评论指出:"这不是AI出错的案例,而是企业对AI管理失职的案例。"英国《金融时报》则分析称,该案例确立了一个关键先例——企业不能以"AI犯的错"来推卸责任。
当没人再相信 AI 说的话
从"技术新鲜感"到"信任危机"
2023年是AI的"惊奇之年",公众对ChatGPT等产品的态度以好奇和赞美为主。2024年进入"应用之年",AI开始嵌入日常场景。而2025年,随着越来越多的事故从"段子"变成"官司",公众情绪正在从兴奋转向警惕。

根据皮尤研究中心2025年初的调研,全球范围内对AI生成信息的平均信任度从2023年的58%下降至41%。在中国,中国社会科学院的一项调查显示,超过七成的受访者表示曾遭遇过AI产生的误导性信息,其中约三成因此遭受了实际经济损失。
AI 闯祸,为什么总是用户买单?
AI幻觉的成本呈现"非对称分布":技术提供方承担声誉损失和法律赔偿,而用户往往承担时间和经济上的直接损失。
在豆包事件中,用户的诉求不仅仅是赔偿,更包含了对平台"安全告知义务"的要求。这反映出一个深层次的社会问题:当AI建议具有"实际行为指导"性质时(如财务操作、医疗建议、法律咨询、出行安排),用户基于对AI品牌的信任采取行动,导致的实际损失应由谁承担?
"幻觉经济"正在形成
AI幻觉甚至催生了值得关注的社会现象。美国一些律师事务所开始专门代理"AI误导"相关集体诉讼。在中国,网络上也开始出现针对AI客服错误信息"薅羊毛"的讨论。这些现象折射出一个尴尬的现实:AI厂商对幻觉问题的漠视,正催生着扭曲的"纠错市场"。
《经济学人》在一篇深度报道中指出:"当AI的说服力超过了它的准确度,它就从一个工具变成了一个风险。"文章进一步警告,如果不进行系统性治理,AI幻觉问题可能成为公众对AI技术信任的"灰犀牛"——一个确定会发生、却不被重视的巨大风险。
法律、技术与企业的三重博弈
1. 欧盟、美国、中国:三种监管思路
面对AI幻觉引发的纠纷,全球主要经济体的治理路径正在分化,但在"企业需为AI行为负责"这一点上正在快速趋同。
欧盟:《人工智能法案》(AI Act)于2024年正式通过,按风险等级对AI系统进行分类管理。欧盟委员会主席冯德莱恩在法案通过时表示:"AI越自信,人类越需要怀疑。"
美国:联邦贸易委员会(FTC)在2024年更新的指南中明确表示,"欺骗性AI输出"适用于现有的消费者保护法规。FTC主席Lina Khan曾公开表态:"ChatGPT的律师费不能由消费者买单。"
中国:2025年初出台了更严格的细则,明确要求AI服务提供者建立"幻觉风险预案机制",对涉及金融、医疗、交通等高风险领域的AI建议,必须强制标注"AI生成,仅供参考"的警示语。《人民日报》评论员文章指出:"AI不能成为跑得比监管快的快车道,容错不等于免责。"
2. 三个必须回答的法律问题
豆包被起诉事件将是中国司法对AI产品责任范围的一次重要检验。从法律角度看,存在几个核心争议点:
第一,AI是否有独立的"法律人格"?加拿大航空案已表明,司法机构倾向于否定AI独立担责的概念,将责任归于背后的运营实体。
第二,用户是否有"合理信赖"的义务?用户是否有责任核实AI建议的准确性,还是可以"合理信赖"AI提供的信息?
第三,告知义务的边界在哪里?AI厂商需要在多大程度上警示用户其输出的不可靠性?
北京大学法学院教授薛军在《法治日报》的采访中表示:"AI输出的法律属性类似于产品,而非信息。如果用户按照你教的方法去操作而导致损失,产品提供者没有理由免责——无论这个产品是人还是一个算法。"
3. 技术治理:让 AI 学会说"我不知道"
在顶层法律之外,产业界也在探索技术层面的治理方案:
检索增强生成(RAG):通过连接外部知识库,让AI在回答时实时检索可靠来源。目前已成为头部厂商的标准方案。
幻觉检测器:Anthropic、百度、阿里等公司都推出了专门的幻觉检测工具,对低置信度内容进行标注或屏蔽。
"不知道"机制:部分大模型开始引入更保守的"认怂"策略——对不确定的问题直接回答"我无法确认"。Google DeepMind在2024年发布的论文中明确将"拒绝回答"视为AI成熟度的标志而非缺陷。
别让"用户体验"掩盖模型不足
如果说法律监管是"外力",技术方案是"工具",那么在法律和技术之间,还有一个关键环节往往被忽略——企业内部的AI治理体系建设。豆包系列事件揭示了一个核心矛盾:当产品体验的"精致"开始为底层模型能力的不足"打掩护",企业到底是该继续在用户体验层"堆料",还是回归到模型能力本身?
豆包的成长路径是观察这一矛盾的绝佳样本。据《晚点LatePost》深度报道,豆包从诞生之初就把"拟人化"和"离用户近"作为核心产品策略——精心挑选的声音、细腻的语调设计、丰富的表情和情绪表达,让豆包在用户感知层面成为一个"有温度的亲密朋友"。这一策略取得了惊人的成功:DAU在不到两年半内突破1亿,成为中国唯一一个日活过亿的AI助手产品。

然而,当DeepSeek在2025年初凭借模型推理能力的突破迅速崛起时,尴尬浮现:大量用户被DeepSeek"不够好看但更聪明"的体验吸引而去。内部员工陷入了自我怀疑——"做了这么多精致的功能,却被功能简单的DeepSeek轻易超过",这些功能的意义到底是什么?
这一转折暴露了一个深层问题:以"用户体验"为名义的过度包装,正在成为掩盖模型能力短板的"粉饰层"。豆包团队在开发过程中多次面临"模型底子不够"的困境——模型无法生成美观的口算竖式,团队手动写代码生成标准格式给模型调用;模型无法辨别网站可信度,团队一个个标注信息来源,建立黑名单;模型输出JSON时常漏掉引号或括号,团队单独写检测修复代码;模型无法正确拆分搜索关键词,团队需要提供大量示例手把手教导。
这种"给模型搭脚手架"的工程做法短期内确实能提升用户体验,但它带来了一种危险的错觉:用户看到的流畅体验,未必是模型能力的真实反映。当产品团队花费大量精力在前端"雕花"时,管理层可能因此低估底层模型能力的差距,从而推迟在基础模型研发上的战略投入。正如豆包员工反思时承认的:"如果底子只是小学生,后面再硬教大学知识,也很难立刻见效。"

从企业治理角度,这要求AI公司建立"能力-体验匹配评估"机制:在每项新功能上线前,不只问"用户喜不喜欢",更要问"我们的模型真的做得到吗"。腾讯研究院在2024年底发布的《企业AI治理白皮书》中提出了"AI输出风险分级"框架,将应用场景分为四级:娱乐级、参考级、建议级、执行级。每一级需要不同的安全冗余和模型能力支撑。
与此同时,企业需要建立"人机协同的兜底机制"——三道防线:模型层(RAG、检测器、拒答机制)、流程层(高风险场景的人工审核)、救济层(纠错和补偿通道)。加航案的教训恰恰在于,它既没有第二道防线,也没有第三道防线。
《财经》杂志的评论一针见血:"AI产品的安全不是纯技术问题,而是管理问题。企业不能一边用AI抢占市场增量,一边用'AI还年轻'的话术推卸事故责任。一个成熟的市场配得上一份成熟的责任说明书。"
《晚点LatePost》在深度报道中提出了一个更本质的追问:"一个拟人化的AI产品应该是像朋友一样永远说'好',还是像真正的朋友一样在不确定时坦诚说'我不知道'?"这个教训不仅属于豆包,也属于所有在"用户体验"与"模型能力"之间摇摆的AI公司。
把 AI 当"说明书"的人,都吃了亏
1. 为什么你对 AI 的话深信不疑?
豆包退票事件最深刻的教训或许在于:用户对待AI的态度,正处在一个危险的"认识断层"中。奥维咨询的一项调查显示,超过六成的用户在使用AI助手时,"没有或很少"对AI输出进行交叉验证。当AI用流畅自然的语言给出具体操作建议时,绝大多数人的第一反应不是"这个信息可靠吗?",而是"它告诉我要怎么做。"
这种认知偏差在心理学上被称为自动化偏差(Automation Bias)——人类倾向于过度信赖自动化系统的输出,即便系统明显存在局限。在AI语境下,这一偏差被流畅的对话界面进一步放大。
2. 比 AI 更重要的,是人的判断力
在"技术端减少幻觉"和"法律端明确责任"之外,用户端的AI素养教育正成为一个关键课题。这包括:
了解AI的能力边界:知道AI不是"全知"的,而是基于概率的文本生成器。
养成交叉验证习惯:对于涉及金钱、健康、法律等实际利益的AI建议,养成"假设它是错的"的思维方式。
区分"创意"与"事实":AI擅长创造性的头脑风暴和文本润色,但不应被当作"搜索引擎"或"政策查询工具"来使用。
《中国青年报》在评论中指出:我们教孩子不要跟陌生人走,现在我们需要教所有人不要跟AI说的走——除非你有独立的验证。

3. AI 厂商不能再只说"仅供参考"
一些国际AI厂商已开始主动改进用户体验中的"信任提示"设计。OpenAI在2024年推出"不太确定"标签,对模型的低置信度回答自动添加黄色警示。微软Copilot则在提供金融、医疗建议时强制要求"验证来源"的交互。
相比之下,国内部分AI产品在"用户体验"和"安全冗余"之间的平衡上仍有改进空间。豆包事件后,有用户反馈称某些AI助手在一些高风险领域的回答中缺少明确的"AI能力边界说明",导致用户在实际操作时产生误判。
结语:AI 需要一场"科目考试"
有一个比喻在科技圈流传甚广:如果AI是一辆车,过去两年我们疯狂地在造"跑得更快"的车,但直到最近才开始认真讨论——这辆车需要刹车、安全气囊和驾驶考试。
豆包被起诉事件不是第一个AI幻觉引发的诉讼,也绝不会是最后一个。加拿大的判例、欧洲的法规、中国的暂行办法,本质上都在回答同一个问题:当AI出错时,谁来买单?
答案正在逐步明晰:企业不能躲在"AI会犯错"的免责声明后面;监管不能等到事故频发后才出手;用户也不能在"看起来很有道理"的流畅回答面前放弃独立思考。
AI的幻觉不是Bug,它是这门技术的"原罪"。而人类社会的智慧,不取决于我们能否彻底消除它,而在于我们能否学会与它共存——用制度划清边界,用法律明确责任,用教育建立认知。
当每个用AI的人都知道"它说的不一定对",AI的价值才真正开始。
参考信息来源:
[1] Civil Resolution Tribunal, "Moffatt v. Air Canada", 2024 BCCRT 149 (Canada)。
[2] 晚点LatePost, "制造豆包:一个AI超级入口的形成与转向", 2025年5月。
[3] 欧盟委员会, "The EU Artificial Intelligence Act", 2024。
[4] 中国国家网信办, 《生成式人工智能服务管理暂行办法》, 2023;2025年细则。
[5] Pew Research Center, "Trust in AI-Generated Information: A Global Survey", 2025。
[6] 中国社会科学院社会学研究所, 《中国公众AI认知与信任调查报告》, 2025。
[7] 腾讯研究院, 《企业AI治理白皮书:分级框架与最佳实践》, 2024。
[8] 中国信息通信研究院, "AI Governance as a Service" 试点报告, 2025。
[9] Google DeepMind, "On the Utility of Knowing When to Say No", arXiv, 2024。
[10] Anthropic, "Model Card for Claude", 2024-2025。
[11] The New York Times, "When A.I. Chatbots Hallucinate", 2024。
[12] Financial Times, "Air Canada AI chatbot ruling sets precedent", 2024。
[13] The Economist, "The Grey Rhino of AI Hallucinations", 2024。
[14] 《人民日报》, "AI不能跑在监管前面"(评论员文章), 2025。
[15] 《法治日报》, 薛军教授专访:"AI输出的法律属性认定", 2025。
[16] 《中国青年报》, "AI时代的信息素养教育", 2025。
[17] 《财经》杂志, "从免责到负责:AI企业的治理命题", 2025。
[18] 奥维咨询(Oliver Wyman), "AI User Behavior & Automation Bias Study", 2024。
[19] US Federal Trade Commission (FTC), "AI and Consumer Protection Enforcement Guidance", 2024。
Token for GOOD Hub用有温度的AI,解决真实世界的问题。
转载请在文章开头和结尾显眼处标注:作者、出处和链接。不按规范转载侵权必究。
未经授权严禁转载,授权事宜请联系作者本人,侵权必究。
本文禁止转载,侵权必究。
授权事宜请至数英微信公众号(ID: digitaling) 后台授权,侵权必究。



评论
评论
推荐评论
暂无评论哦,快来评论一下吧!
全部评论(0条)