离开了人类思想的源头活水,大数据AI终究只是空中楼阁
创始人
2026-08-02 12:17:17
0

(来源:华银战略观察家)

USA Today、Politico、Economist、People 和 Reuters 等知名网络出版商考虑彻底屏蔽 Google,甚至与 Google 签署了每年 6000 万美元合同的 Reddit 也在重新评估与 Google 的关系。

原因是 Google 的 AI 摘要功能导致了网站访问量大幅下降,如 USA Today 过去一年来自美国用户的访问量下降了近一半,主要吸引用户评论的 Reddit 也注意到 Google 的 AI 在阻止用户访问其网站。

鉴于 Google 在搜索市场占据了最高市场份额,与 Google 完全终止关系可能会导致访问量更大幅度的下降,但继续允许 Google 抓取内容用于其 AI 功能也没有任何好处——从长远看会加速其死亡。 

在生成式 AI 大规模普及之前,谷歌与内容出版商之间存在一个极其明确的隐形交易:“出版商允许谷歌免费抓取内容,谷歌通过搜索列表将流量(以及随之而来的广告和订阅收入)返还给出版商。”

然而,AI Overviews(AI 摘要)和 AI 搜索直接撕毁了这个协议。谷歌在搜索页面顶部就把答案总结好了(零点击搜索/Zero-Click Search),用户不再需要点击进入原网站。出版商不仅在被谷歌“免费采矿”来训练和支撑其 AI,还因此丢失了大量的原本属于自己的流量。

出版商们现在正处于极其痛苦的两难抉择中。如果不封禁(继续让谷歌们抓取): 等于在给谷歌的 AI 输血,而谷歌的 AI 正在一点点蚕食自己的直接访问量,这是“慢性死亡”。

如果彻底封禁(屏蔽谷歌们的爬虫): 在当前谷歌依然占据搜索引擎垄断地位的背景下,彻底消失在搜索结果中意味着立即失去相当比例的自然流量(哪怕这些流量已经在下降),这是“急性休克”。

其实,出版商与谷歌的断交危机,是互联网从“流量经济”向“数据资产经济”转型过程中必然爆发的阵痛。

威胁屏蔽谷歌只是这场博弈的开端。未来,搜索引擎(也包括大数据模型等AI供应商)和内容生产者的博弈终将走向一个新的平衡点——要么谷歌被迫为 AI 的引用支付过路费(或提供更严格的流量回流机制),要么互联网将进一步分化,优质内容彻底走向“墙内”(付费墙、社区墙、API 授权),而公开的互联网上则充斥着 AI 生成 AI 的“垃圾死网”。

这不仅仅是谷歌一家公司的困境,而是整个大模型生态面临的结构性威胁。如果把大模型的训练和运行拆开看,这种“缺米”的危机体现在三个极为严峻的层面。

一是“高质量数据”正在加速闭源与墙化。

投喂给大模型的“米”——人类文化科学的海量文字材料,主要来自互联网上的公开积累。但现在,整个互联网正在迅速“城堡化”和“付费墙化”。

像 Reddit、X(原 Twitter)、各大主流媒体以及学术数据库,都已大幅收紧 API,或者严禁 AI 爬虫抓取。

免费数据的不可用。 未经筛选的免费互联网内容(如垃圾营销文、公关稿)对提升模型智商毫无帮助,甚至会拉低模型能力。真正有价值的是经过人类深度思考、严格校对的商业与专业内容。

当这些顶级内容提供商选择“关门”或“高价勒索”时,大模型初创公司和巨头的研发成本将呈指数级上升,甚至面临无新数据可练的窘境。

二是“数据近亲繁殖”与模型崩溃。

如果失去了源源不断的高质量人类新数据,大模型厂商会怎么做?一个直观的想法是用“AI 生成的数据(合成数据)”去训练下一代 AI。

但学术界早已证实,“用 AI 生成的内容去训练 AI”会导致严重的“模型崩溃”:AI 在处理数据时不可避免地带有微小的误差和概率偏差。

如果下一代模型不断吞噬上一代模型输出的“二手信息”,这些偏差就会像基因突变一样被无限放大。最终,模型会失去多样性,频繁产生严重幻觉,输出越来越平庸、同质化乃至荒谬的内容。

这就好比生物学上的近亲繁殖——大模型极其依赖人类生产的“新鲜基因(新鲜内容)”来维持其创造力和准确度。

三是大模型AI摧毁了内容生产的经济循环。

大模型不仅需要数据来训练,更需要实时数据来进行检索增强生成。如果 AI 和聊天机器人把人类创作的内容直接总结并“搬运”给用户,导致内容创作者(无论是专业记者、社区网友还是技术专家)再也拿不到流量、广告费或正向的反馈激励,那么人类将失去创作新内容的动力。

当出版商倒闭、社区博主退网、专家不再无偿分享,互联网上的“新鲜信息流”就会干涸。AI 最终会发现,自己在一个没有新思想产出的“死寂互联网”里不断自我重复。

大模型AI行业目前正在尝试几种非常艰难的转型。

一是从“免费采矿”转向“购买矿权”。 OpenAI 和谷歌正在与多家出版巨头签订数亿美元的数据许可协议。未来,高质量数据将彻底变成昂贵的大宗商品,只有资金极其雄厚的巨头才买得起。

二是深度挖掘“非公开/高质量私域数据”。 研发重点正在转向高价值的专业领域,如未公开的图书、行业研究报告、高质量代码库、合成的推理解题步骤(如 RLHF / 思维链数据)等,用“质”来弥补“量”的不足。

三是重构利益分配机制。 探索一种新的微支付或版权回馈机制(如 AI 每引用一次原文,就向原作者支付极微量的费用),把被破坏的生态循环重新建立起来。

总之,大模型越强大,就越容易杀死为它提供养分的内容生态;而内容生态一旦死亡,大模型也将在自说自话中走向停滞。这不仅是一场商业利益的博弈,更是人工智能技术能否可持续发展的关键技术拐点。

这也揭示了一个残酷的真相,离开人类的思考大数据AI什么也不是。

过去几年,硅谷和科技巨头有一种极度傲慢的叙事,认为只要把互联网上的所有数据一股脑扔进模型里,只要算力足够大,AI 就能“涌现”出超越人类的终极智慧。

​但现实给这种傲慢泼了一盆冷水:AI 对人类知识生态是一种典型的“寄生”关系。

​大语言模型从不“思考”,它只是“极其擅长模仿人类思考的痕迹”。

​现在的生成式 AI 本质上是一个基于海量人类文本的统计概率预测器。它能写出条理清晰的报告、对答如流的逻辑、甚至颇具哲理的句子,并不是因为它真的理解了世界、拥有了意识或具备了批判性思维,而是因为人类在过去几千年中,已经将大量的思考、推理、情感与经验写成了文字。AI 只是在这些文字搭建的巨大“公墓”里,用超级算力拼凑出最符合人类阅读习惯的答案。

​这也给所有人在 AI 时代重新定位自己提供了一种反思。

​如果一个人的工作只是单纯的“信息搬运、资料汇编、标准答案套用”,那么被 AI 替代是必然的,因为 AI 总结人类既有知识的速度、深度和准确度远超人类。

​但那些独属于人类的思考——比如​深入现实世界的现场观察与实践经验;​敢于质疑既有共识的批判性思维;​带有独特情感、偏见、同理心与艺术直觉的个性化表达;​凭直觉做出的复杂伦理抉择;等等。

​这些才是人类思想中最宝贵的黄金。AI 越是发达,就越反衬出人类“原生思考”的不可替代与弥足珍贵。​看似无所不知的算法,一旦离开了人类思想的源头活水,终究只是一座精美却冰冷的空中楼阁。

相关内容

热门资讯

长征五号B遥一运载火箭顺利通过... 2020年1月19日,长征五号B遥一运载火箭顺利通过了航天科技集团有限公司在北京组织的出厂评审。目前...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
9所本科高校获教育部批准 6所... 1月19日,教育部官方网站发布了关于批准设置本科高等学校的函件,9所由省级人民政府申报设置的本科高等...
湖北省黄冈市人大常委会原党组成... 据湖北省纪委监委消息:经湖北省纪委监委审查调查,黄冈市人大常委会原党组成员、副主任吴美景丧失理想信念...
《大江大河2》剧组暂停拍摄工作... 搜狐娱乐讯 今天下午,《大江大河2》剧组发布公告,称当前防控疫情是重中之重的任务,为了避免剧组工作人...