Whodunit?面向作者身份归因的对比学习
计算与语言
2022-10-11 v2 人工智能
机器学习
摘要
作者身份归因是识别给定文本作者的任务。关键在于寻找能够区分不同作者的表示。现有方法通常使用手动设计的特征来捕捉数据集的内容与风格,但这些方法依赖于数据集且在不同语料上表现不一致。在本工作中,我们提出通过以对比目标(Contra-X)微调预训练通用语言表示来学习作者特定表示。我们表明Contra-X学习到的表示能为不同作者形成高度可分离的簇。它在多个人工与机器作者身份归因基准上推进了最先进水平(SOTA),相较交叉熵微调实现了最高达6.8%的提升。然而,我们发现Contra-X以牺牲某些作者性能为代价提升了整体准确率。解决这一矛盾将是未来工作的重要方向。据我们所知,我们首个将对比学习与预训练语言模型微调结合用于作者身份归因。
引用
@article{arxiv.2209.11887,
title = {Whodunit? Learning to Contrast for Authorship Attribution},
author = {Bo Ai and Yuchen Wang and Yugin Tan and Samson Tan},
journal= {arXiv preprint arXiv:2209.11887},
year = {2022}
}
备注
camera-ready version, AACL-IJCNLP 2022