中文

Whodunit?面向作者身份归因的对比学习

计算与语言 2022-10-11 v2 人工智能 机器学习

摘要

作者身份归因是识别给定文本作者的任务。关键在于寻找能够区分不同作者的表示。现有方法通常使用手动设计的特征来捕捉数据集的内容与风格,但这些方法依赖于数据集且在不同语料上表现不一致。在本工作中,我们提出通过以对比目标(Contra-X)微调预训练通用语言表示来学习作者特定表示。我们表明Contra-X学习到的表示能为不同作者形成高度可分离的簇。它在多个人工与机器作者身份归因基准上推进了最先进水平(SOTA),相较交叉熵微调实现了最高达6.8%的提升。然而,我们发现Contra-X以牺牲某些作者性能为代价提升了整体准确率。解决这一矛盾将是未来工作的重要方向。据我们所知,我们首个将对比学习与预训练语言模型微调结合用于作者身份归因。

关键词

引用

@article{arxiv.2209.11887,
  title  = {Whodunit? Learning to Contrast for Authorship Attribution},
  author = {Bo Ai and Yuchen Wang and Yugin Tan and Samson Tan},
  journal= {arXiv preprint arXiv:2209.11887},
  year   = {2022}
}

备注

camera-ready version, AACL-IJCNLP 2022