EMBRACE:通过对齐隐式对话与社会规范塑造包容性意见表示
计算与语言
2025-11-11 v2
摘要
塑造能够包容多样性、确保公平参与和价值观反映的包容性表示是许多基于对话的模型的核心目标。然而,许多现有方法依赖于表面包容性,即通过提及用户人口统计信息或社会群体的行为属性来实现。此类方法忽略了嵌入在对话中的细微、隐式的意见表达。此外,过度依赖显性线索会加剧模型输出中的误对齐并强化有害或刻板的表示。因此,我们后退一步,认识到包容性需要考虑意见的隐式表达,并使用响应的立场来验证规范对齐。这项研究旨在评估 NLP 或计算模型中意见的表示方式,通过引入一种对齐评估框架,突出显示通常被忽视的隐式对话,并评估规范社会观点和话语。我们的 метод将响应的立场建模为底层意见的代理,从而实现对多样化社会观点进行体贴和反思的表示。我们使用两种方法进行评估:(i) 使用基分类器的正-未标记(PU)在线学习,和 (ii) 使用指令调校语言模型来评估后训练对齐。通过这种方式,我们提供了一种原则性且结构化的视角来审视隐式意见的(误)表示,并为更包容的模型行为提供了一条途径。
引用
@article{arxiv.2507.20264,
title = {EMBRACE: Shaping Inclusive Opinion Representation by Aligning Implicit Conversations with Social Norms},
author = {Abeer Aldayel and Areej Alokaili},
journal= {arXiv preprint arXiv:2507.20264},
year = {2025}
}
备注
Accepted, to appear IJCNLP-AACL 2025 Findings