训练数据归因(TDA):其采纳与用例探讨
计算机与社会
2025-01-23 v1
摘要
本报告调查了训练数据归因(Training Data Attribution, TDA)及其对减少AI的极端风险的重要性与可行性。首先,我们讨论了将现有TDA研究成果从当前状态提升至能够在前沿大型语言模型上运行的高效准确工具所需的可行性及所需 effort。接着,我们讨论了AI实验室将从使用此类TDA工具中期待看到的诸多研究收益。然后,我们讨论了一个关键待解决的瓶颈,这会限制此类TDA工具在公众可及范围:AI实验室愿意披露其训练数据的程度。我们提出了AI实验室可能的解决方案,并讨论了政府愿意强制实施此类访问的可能性。假设AI实验室乐于提供TDA推断的访问权限,我们进一步讨论了可能看到的高层次社会效益。我们列举并讨论了一系列可能由TDA所支持的政策和系统。最后,我们评估了TDA在缓解AI系统大规模风险方面的潜在影响。
引用
@article{arxiv.2501.12642,
title = {Training Data Attribution (TDA): Examining Its Adoption & Use Cases},
author = {Deric Cheng and Juhan Bae and Justin Bullock and David Kristofferson},
journal= {arXiv preprint arXiv:2501.12642},
year = {2025}
}