中文

利用领域知识实现包容且偏见感知的人道主义响应条目分类

计算与语言 2023-05-31 v2 机器学习

摘要

在人道主义危机期间准确而迅速的形势分析对于高效提供人道主义援助至关重要,并且是人道主义准则与“不让任何人掉队”(LNOB)原则的基础。此类数据分析可极大受益于语言处理系统,例如依据人道主义本体对文本数据进行分类。然而,简单地微调通用大语言模型(LLM)来应对此问题涉及显著的实践与伦理问题,特别是在数据稀疏且复杂的子域上效果不佳,以及对社会偏见和不当关联的编码。在本工作中,我们旨在提供一种有效且具伦理意识的人道主义数据分析系统。我们的方法包括:(1)引入适配人道主义分析框架的新型架构,(2)创建并发布一个名为 HumBert 的新型人道主义专用 LLM,以及(3)提出一种测量与缓解偏见的系统方法。我们的实验结果表明,相较于强基线模型,我们的方法在零样本与全训练设定下均具有更优性能,同时也揭示了所得 LLM 中存在的偏见。利用针对性的反事实数据增强方法,我们在不损害性能的前提下显著减少了这些偏见。

关键词

引用

@article{arxiv.2305.16756,
  title  = {Leveraging Domain Knowledge for Inclusive and Bias-aware Humanitarian Response Entry Classification},
  author = {Nicolò Tamagnone and Selim Fekih and Ximena Contla and Nayid Orozco and Navid Rekabsaz},
  journal= {arXiv preprint arXiv:2305.16756},
  year   = {2023}
}

备注

Accepted at IJCAI 2023