ACL 2026 · 主会

数据传粉

推动 AI 种群演化的涌现生态过程

Shufang Xie1,* Qizhi Pei1,* Ang Lv1 Jingyang Hu1 Lijun Wu2 Rui Yan3,†

1中国人民大学高瓴人工智能学院  ·  2上海人工智能实验室  ·  3武汉大学人工智能学院

*同等贡献  ·  通讯作者: rui.yan@whu.edu.cn

数据传粉循环:部署后的模型用合成输出填充网络,这些内容又被抓取并用于训练下一代模型。
数据传粉循环。 模型使用会在公共网络上留下合成文本。后续的数据收集可能把这些文本带回新的训练语料, 从而在模型家族之间形成一条松散的继承路径。

TL;DR

大语言模型从网络中训练出来,又把内容写回网络。它们的回答会进入帖子、文档、代码和数据集; 下一轮网页抓取可能再次收集这些内容。我们把这条继承通道称为 数据传粉。论文想回答一个简单问题:如果模型可以通过数据彼此影响, 下一代模型会发生什么?我们分析了 27 个已部署模型,并用 320 个小规模语言模型 做受控实验。结果给出了一幅更接近生态系统的图景:单条递归链容易坍塌, 多样化模型种群稳定得多。

基本想法

讨论合成数据时,大家常用一个简单循环。模型训练在自己的输出上,罕见模式慢慢消失, 分布越来越窄。多轮之后,模型开始坏掉。

真实互联网要复杂得多。许多模型同时被使用。用户把有用的输出发布到网上。 爬虫再把这些输出和人类写的文本混在一起。实验室不需要共享权重,模型也不需要直接调用彼此。 语料本身成了载体。

数据传粉就是给这个载体命名。它把问题从一次训练运行,推到模型被使用、发布、抓取、 再训练的整个环境中。

我们怎么验证

我们用了两类证据。一类看已经在现实中运行的模型。另一类搭一个小环境,把循环控制起来。

已部署模型分析是间接证据。没有专有训练语料,我们无法证明精确的数据来源链条。 纯合成受控实验用来在已知条件下检验这一机制。

基于种群的演化框架图。
基于种群的演化框架。 选择保留用户更可能放大的模型。变异加入小幅训练漂移。 交叉让一个模型继承参数,同时在另一个模型的合成数据上继续训练。

结果显示

1. 模型家族没有看上去那么分开

如果每个模型家族都独立演化,跨家族语言指纹应该明显不同于家族内指纹。实际边界更模糊。 在 5 个家族、27 个已部署模型中,家族内和跨家族相似度分布有明显重叠 (重叠系数 = 0.313,Cliff's δ = −0.572)。

时间方向更关键。较新的模型更像较早模型,反向关系弱得多。 这个模式符合一种现实路径:早期部署系统的输出进入了后续训练材料。

家族内与跨家族相似度的密度分布。
家族内与跨家族词汇指纹相似度。
行归一化的跨家族相似度矩阵。
行归一化的跨家族相似度矩阵。
有向影响与发布时间差。
时间不对称性。 有向影响与发布时间差。 正时间差占主导,指向从较老模型到较新模型的影响方向。

2. 种群会改变坍塌故事

最脆弱的情况,是单个谱系不断吃自己越来越扭曲的输出。我们复现了这种基线,它确实会坍塌。 接着保持纯合成数据条件不变,只把训练组织成一个种群。轨迹变了:320 个模型的演化种群在 MMLU、WinoGrande、MathQA 和 SIQA 上保持稳定或提升。在 MMLU 和 MathQA 这类推理任务上, 性能会随代际推进而提升

MMLU 性能随代际变化。
MMLU
WinoGrande 性能随代际变化。
WinoGrande
MathQA 性能随代际变化。
MathQA
SIQA 性能随代际变化。
SIQA

生成样例更直观。基于种群的模型到第 4 代仍然语法正确、贴合主题。 单个递归模型到第 2 代就开始漂移成元数据、URL 和重复片段。

同一生成样例在种群模型与单模型递归训练中的 5 代对比。
同一个奇幻提示,连续 5 代。 左:演化种群保持连贯。 右:单模型递归训练在第 2 代坍塌为类似 URL 的重复。

3. 多样性提供缓冲

种群不会让每个模型都保持优秀。它保留了足够多相对独立的谱系,让某个模型的错误不容易变成所有模型的错误。 在高斯设置中,所有估计器同时变差的概率会随估计器数量指数级下降。在语言模型实验里,同样的模式也出现了: 更大的种群更稳定,小种群则更容易停滞或摇摆。

高斯估计:种群保持在真实值附近,单个估计器发生漂移。
1000 代高斯模拟。种群(蓝色)锚定在真实值附近;单个估计器(橙色)发生漂移。
不同种群规模下的 MMLU 性能(N=4, 9, 16)。
种群规模阈值:只有 N = 16 能持续提升。
5 代模型补全结果的 t-SNE 可视化。
语义多样性持续存在。 5 代模型补全结果的 t-SNE 可视化: 提示聚类和簇内扩散都得以保留,因此种群没有收敛到单一输出风格。

为什么重要

合成数据常被讨论成一个好坏问题。实验提示我们换一个问题:数据流经的生态是什么样的? 单一家族生态可能把同样的盲点复制到各处。多样化种群能让不同的行为路径活得更久。

这意味着种群结构应该被当成设计变量。研究模型坍塌时,需要超出单条递归链。 构建系统时,也要保留真正不同的数据来源、模型家族和评估信号。 这里的多样性是一种韧性基础设施。

我们不声称已部署模型的语言指纹能证明精确训练数据谱系;受控实验中的模型也远小于前沿系统。 这项工作说明种群动力学值得认真对待。它不保证某个现实生产生态一定安全。

简短结论

BibTeX

@inproceedings{xie-etal-2026-data,
  title     = {Data Pollination: An Emergent Ecological Process Driving {AI} Population Evolution},
  author    = {Xie, Shufang and Pei, Qizhi and Lv, Ang and Hu, Jingyang
               and Wu, Lijun and Yan, Rui},
  editor    = {Liakata, Maria and Moreira, Viviane P. and Zhang, Jiajun
               and Jurgens, David},
  booktitle = {Proceedings of the 64th Annual Meeting of the {A}ssociation
               for {C}omputational {L}inguistics (Volume 1: Long Papers)},
  year      = {2026},
  month     = jul,
  address   = {San Diego, California, United States},
  publisher = {Association for Computational Linguistics},
  url       = {https://aclanthology.org/2026.acl-long.1229/},
  doi       = {10.18653/v1/2026.acl-long.1229},
  pages     = {26698--26721},
  ISBN      = {979-8-89176-390-6}
}