ACL 2026 · 主会
数据传粉
推动 AI 种群演化的涌现生态过程
1中国人民大学高瓴人工智能学院 · 2上海人工智能实验室 · 3武汉大学人工智能学院
*同等贡献 · †通讯作者: rui.yan@whu.edu.cn
TL;DR
大语言模型从网络中训练出来,又把内容写回网络。它们的回答会进入帖子、文档、代码和数据集; 下一轮网页抓取可能再次收集这些内容。我们把这条继承通道称为 数据传粉。论文想回答一个简单问题:如果模型可以通过数据彼此影响, 下一代模型会发生什么?我们分析了 27 个已部署模型,并用 320 个小规模语言模型 做受控实验。结果给出了一幅更接近生态系统的图景:单条递归链容易坍塌, 多样化模型种群稳定得多。
基本想法
讨论合成数据时,大家常用一个简单循环。模型训练在自己的输出上,罕见模式慢慢消失, 分布越来越窄。多轮之后,模型开始坏掉。
真实互联网要复杂得多。许多模型同时被使用。用户把有用的输出发布到网上。 爬虫再把这些输出和人类写的文本混在一起。实验室不需要共享权重,模型也不需要直接调用彼此。 语料本身成了载体。
数据传粉就是给这个载体命名。它把问题从一次训练运行,推到模型被使用、发布、抓取、 再训练的整个环境中。
我们怎么验证
我们用了两类证据。一类看已经在现实中运行的模型。另一类搭一个小环境,把循环控制起来。
- 真实世界:比较 27 个已部署模型的语言指纹,覆盖 Claude、GPT、Gemma、Llama 和 Mistral 五个家族。
- 受控实验:在纯合成数据训练中演化 320 个小规模语言模型,构建 N = 16 的种群并运行 5 代。
- 机制分析:用高斯分析、种群规模消融和语义嵌入可视化,检验多样性是否解释了韧性。
已部署模型分析是间接证据。没有专有训练语料,我们无法证明精确的数据来源链条。 纯合成受控实验用来在已知条件下检验这一机制。
结果显示
1. 模型家族没有看上去那么分开
如果每个模型家族都独立演化,跨家族语言指纹应该明显不同于家族内指纹。实际边界更模糊。 在 5 个家族、27 个已部署模型中,家族内和跨家族相似度分布有明显重叠 (重叠系数 = 0.313,Cliff's δ = −0.572)。
时间方向更关键。较新的模型更像较早模型,反向关系弱得多。 这个模式符合一种现实路径:早期部署系统的输出进入了后续训练材料。
2. 种群会改变坍塌故事
最脆弱的情况,是单个谱系不断吃自己越来越扭曲的输出。我们复现了这种基线,它确实会坍塌。 接着保持纯合成数据条件不变,只把训练组织成一个种群。轨迹变了:320 个模型的演化种群在 MMLU、WinoGrande、MathQA 和 SIQA 上保持稳定或提升。在 MMLU 和 MathQA 这类推理任务上, 性能会随代际推进而提升。
生成样例更直观。基于种群的模型到第 4 代仍然语法正确、贴合主题。 单个递归模型到第 2 代就开始漂移成元数据、URL 和重复片段。
3. 多样性提供缓冲
种群不会让每个模型都保持优秀。它保留了足够多相对独立的谱系,让某个模型的错误不容易变成所有模型的错误。 在高斯设置中,所有估计器同时变差的概率会随估计器数量指数级下降。在语言模型实验里,同样的模式也出现了: 更大的种群更稳定,小种群则更容易停滞或摇摆。
为什么重要
合成数据常被讨论成一个好坏问题。实验提示我们换一个问题:数据流经的生态是什么样的? 单一家族生态可能把同样的盲点复制到各处。多样化种群能让不同的行为路径活得更久。
这意味着种群结构应该被当成设计变量。研究模型坍塌时,需要超出单条递归链。 构建系统时,也要保留真正不同的数据来源、模型家族和评估信号。 这里的多样性是一种韧性基础设施。
我们不声称已部署模型的语言指纹能证明精确训练数据谱系;受控实验中的模型也远小于前沿系统。 这项工作说明种群动力学值得认真对待。它不保证某个现实生产生态一定安全。
简短结论
- AI 模型可以通过公共数据彼此继承。
- 单条递归训练链确实可能坍塌。
- 在我们的受控实验中,多样化模型种群更稳定。
- 未来研究 AI 系统,需要看单个模型,也需要看模型种群。
BibTeX
@inproceedings{xie-etal-2026-data,
title = {Data Pollination: An Emergent Ecological Process Driving {AI} Population Evolution},
author = {Xie, Shufang and Pei, Qizhi and Lv, Ang and Hu, Jingyang
and Wu, Lijun and Yan, Rui},
editor = {Liakata, Maria and Moreira, Viviane P. and Zhang, Jiajun
and Jurgens, David},
booktitle = {Proceedings of the 64th Annual Meeting of the {A}ssociation
for {C}omputational {L}inguistics (Volume 1: Long Papers)},
year = {2026},
month = jul,
address = {San Diego, California, United States},
publisher = {Association for Computational Linguistics},
url = {https://aclanthology.org/2026.acl-long.1229/},
doi = {10.18653/v1/2026.acl-long.1229},
pages = {26698--26721},
ISBN = {979-8-89176-390-6}
}