中文

通过语义嵌入和对比学习从内容中隔离作者身份

计算与语言 2024-11-28 v1 机器学习

摘要

作者身份在风格和内容中交织在一起。作者经常以相同的风格写作相同的主题,因此,当不同的作者写作完全相同的主题时,最容易区分它们的方法是理解其风格细微差别。现代神经网络模型用于作者身份可以利用对比学习捕获这些特征,但总会存在一些内容泄漏。我们的目标是减少内容与作者身份之间的必然影响和相关性。我们提出了一种技术方法,使用对比学习(InfoNCE)结合额外的人工负样本,这些负样本是通过语义相似性模型人工创建的。这种解耦技术旨在距离内容嵌入空间和风格嵌入空间,从而产生更受风格信息驱动的嵌入。我们在两个不同的数据集上进行ablation研究,并与之进行比较,评估其在零样本挑战中的表现。结果在针对活跃作者的具有挑战性的评估中显示出明显的性能提升,尤其是在设置 particularly 困难的情况下,准确率可提高最高可达10%。此外,对挑战性任务的试验也表明了该方法在保持零样本能力方面的鲁性,同时进行微调。

关键词

引用

@article{arxiv.2411.18472,
  title  = {Isolating authorship from content with semantic embeddings and contrastive learning},
  author = {Javier Huertas-Tato and Adrián Girón-Jiménez and Alejandro Martín and David Camacho},
  journal= {arXiv preprint arXiv:2411.18472},
  year   = {2024}
}