中文

通过缓解人口统计术语影响来提高常识偏置分类器的性能

计算与语言 2024-06-12 v1 人工智能

摘要

理解常识知识是自然语言处理(NLP)领域的关键任务。然而,常识知识中存在的人口统计术语可能潜在地危及NLP模型的性能。本研究旨在调查并提出方法,以提高常识极化分类器的性能和效果,通过缓解人口统计术语的影响。本文引入了三种方法:(1)人口统计术语的层次化泛化;(2)基于阈值的增强;(3)层次化泛化与基于阈值的增强方法的集成(IHTA)。第一种方法涉及根据术语层次本体将人口统计术语替换为更通用的术语,以期缓解特定术语的影响。为解决偏见相关信息有限的问题,第二种方法通过比较这些术语被遮盖与未遮盖时模型预测的变化来衡量人口统计术语的极化程度。该方法通过替换具有高极化值的术语的谓词为由ChatGPT生成的同义词来增强包含此类术语的常识句子。第三种方法结合了前两种方法,先采用基于阈值的增强,再进行层次化泛化。实验表明,第一种方法相对于基线提高了2.33%的准确率,第二种方法相对于标准增强方法提高了0.96%的准确率。IHTA技术相对于基于阈值的增强方法提高了8.82%的准确率,相对于标准增强方法提高了9.96%的准确率。

关键词

引用

@article{arxiv.2406.07229,
  title  = {Improving Commonsense Bias Classification by Mitigating the Influence of Demographic Terms},
  author = {JinKyu Lee and Jihie Kim},
  journal= {arXiv preprint arXiv:2406.07229},
  year   = {2024}
}

备注

10 pages, 5 figures, conference presentation, supported by MSIT (Korea) under ITRC program (IITP-2024-2020-0-01789) and AI Convergence Innovation HR Development (IITP-2024-RS-2023-00254592)