中文

面向数据高效多领域立场检测的主题引导采样

计算与语言 2023-09-19 v1 人工智能 信息检索 统计计算 机器学习

摘要

立场检测旨在识别作者对感兴趣目标所表达的态度。该任务跨越多个领域,从社交媒体意见识别到法律主张的立场检测。然而,这些领域内任务的框架在数据收集协议、标签字典和可用标注数量方面各不相同。此外,这些立场标注在主题内和主题间的基础上存在显著不平衡。这使得多领域立场检测成为一项具有挑战性的任务,需要标准化与领域自适应。为克服这一挑战,我们提出了 T\textbf{T}opic E\textbf{E}fficient St\textbf{St}ancE\textbf{E} D\textbf{D}etection (TESTED),包含一种主题引导的多样性采样技术以及用于微调立场分类器的对比目标。我们在包含 1616 个数据集的现有基准上评估该方法,进行了域内(即所有主题可见)与域外(即未见主题)实验。结果表明,我们的方法优于 state-of-the-art,在域内平均提升 3.53.5 个 F1 点数,并且在域外评估中平均提升 10.210.2 个 F1 点数,同时仅使用 10%\leq10\% 的训练数据。我们表明我们的采样技术缓解了主题间与主题内的类别不平衡。最后,我们的分析表明,对比学习目标使模型能够对具有不同标签的样本实现更显著的分割。

关键词

引用

@article{arxiv.2306.00765,
  title  = {Topic-Guided Sampling For Data-Efficient Multi-Domain Stance Detection},
  author = {Erik Arakelyan and Arnav Arora and Isabelle Augenstein},
  journal= {arXiv preprint arXiv:2306.00765},
  year   = {2023}
}

备注

ACL 2023 (Oral)