LG4AV:结合语言模型与图神经网络进行作者验证
机器学习
2022-08-25 v1 人工智能
计算与语言
摘要
文档作者身份的自动验证在各种场景下十分重要。例如,研究者以其发表文章的数量与影响力被评判和比较,公众人物则面临其在社交媒体平台上的发帖。因此,常用网络服务与平台中的作者信息正确与否十分重要。给定文档是否由某给定作者撰写的问题通常被称为作者验证(AV)。尽管 AV 总体上被广泛研究,但仅有少数工作考虑文档短小且风格相当统一的场景。这使得多数方法在学术领域的在线数据库与知识图谱中不实用。此处需验证科学出版物的作者身份,往往仅有摘要与标题可用。为此,我们提出新方法 LG4AV,其结合语言模型与图神经网络进行作者验证。通过将可用文本直接输入预训练 transformer 架构,我们的模型不需要任何在写作风格至少部分标准化的场景中无意义的手工设计文体特征。通过引入图神经网络结构,我们的模型可利用对验证过程有意义的作者间关系。例如,科学作者更可能撰写其合作者所涉主题,而 twitter 用户倾向于发布其关注者相同的主题。我们经实验评估了模型,并研究了在文献计量环境中纳入合作关系在多大程度上增强验证决策。
引用
@article{arxiv.2109.01479,
title = {LG4AV: Combining Language Models and Graph Neural Networks for Author Verification},
author = {Maximilian Stubbemann and Gerd Stumme},
journal= {arXiv preprint arXiv:2109.01479},
year = {2022}
}
备注
9 pages, 1 figure