中文

FairFlow:一种面向NLP的数据驱动反事实数据增强自动化方法

计算与语言 2024-07-24 v1

摘要

尽管语言模型不断发展,但它们仍会不经意地呈现出从训练数据中学习到的有害社会偏见和刻板印象。这些内在偏见常常在各种应用中导致不利后果。反事实数据增强(CDA),即寻求在训练数据中平衡人口统计属性,已是缓解自然语言处理中偏见的广泛采用的做法。然而,许多现有CDA方法依赖于使用手动编译的词对词典进行的词替换技术,这些技术常常导致替换不够语境,导致潜在的质量问题。另一方面,模型化方法的发展则受到需要平行训练数据的挑战。该领域的工作会诉诸使用手动生成的平行数据,这些数据昂贵且规模有限。本文提出了FairFlow,这是一种自动化生成平行数据以训练反事实文本生成模型的方法,大大减少了对人工干预的需求。此外,我们展示了FairFlow显著克服了基于词典的词替换方法的局限性,同时保持良好的性能。

关键词

引用

@article{arxiv.2407.16431,
  title  = {FairFlow: An Automated Approach to Model-based Counterfactual Data Augmentation For NLP},
  author = {Ewoenam Kwaku Tokpo and Toon Calders},
  journal= {arXiv preprint arXiv:2407.16431},
  year   = {2024}
}