中文

面向公平AI的全球视角下的校准 grounding 合成数据

计算与语言 2024-06-19 v2

摘要

稳健AI模型的开发高度依赖可用训练数据的质量和多样性。在数据稀缺的领域,合成数据生成提供了关键解决方案。本文引入一种新方法,用于创建以真实世界多样性为基础并通过战略性多样化丰富的合成数据集。我们收集了来自125个国家、覆盖12种语言的新闻文章,确保语言和文化代表性的广度。通过强制性的话题多样化、翻译和摘要,最终得到的数据集准确反映真实世界的复杂性,解决了传统数据集中代表性不足的问题。该方法最初应用于命名实体识别(NER),可作为诸多AI领域的模型,其中数据多样化对于通用性至关重要。初步结果显示,在传统NER基准测试中,性能提升了最高可达7.3%,突显了合成数据在模拟全球数据源的丰富、多样细微差别方面的有效性。本文概述了用于合成数据集策划的策略,并提供了该校准数据集用于NER。

关键词

引用

@article{arxiv.2406.10258,
  title  = {Curating Grounded Synthetic Data with Global Perspectives for Equitable AI},
  author = {Elin Törnquist and Robert Alexander Caulk},
  journal= {arXiv preprint arXiv:2406.10258},
  year   = {2024}
}