合成数据与真理地位的转移
计算机与社会
2025-09-18 v1 人工智能
机器学习
摘要
合成数据的出现,既用于隐私保护,又可用于生成训练数据,或仅为便利地获取任意形态和体积的准真实数据,使得“真理”这一概念变得复杂。合成数据模仿真实世界观察,但不涉及外部特征。尽管如此,研究人员仍可将合成数据用作AI模型的训练数据和真理数据仓库。有人声称,数据真实性的缺失不仅是一种可接受的权衡,甚至常常导致比真实数据更好的模型性能:补偿已知偏见,防止过拟合,并支持模型处理意外离群值的鲁棒性。事实上,将噪声甚至完全不合理的数据注入训练集对模型有益。这极大地复杂化了基于代表性精确性决定数据保真度的常规假设(垃圾进,垃圾出)。此外,真理变得是一种自指性的事务,其作为真理数据仓库所使用的标签本身就是生成模型的合成产品,与真实世界观察相互独立。我的论文考察在此类悖论性情境下,如何在不依赖代表性和真实世界参考的稳定真理基础的情况下,引导机器学习研究者和实践者构建真理。它还将反思从代表性转向一种类似或象征性数据概念的更广泛影响。
引用
@article{arxiv.2509.13355,
title = {Synthetic Data and the Shifting Ground of Truth},
author = {Dietmar Offenhuber},
journal= {arXiv preprint arXiv:2509.13355},
year = {2025}
}
备注
Talk presented at the Society for the Social Studies of Science (4S) 2025 meeting in Seattle, Sept. 3, 2025