基于注意力相似度学习的社交媒体可解释作者验证
计算与语言
2019-11-21 v2
摘要
作者验证是分析两篇或多篇文本的语言模式以确定其是否由同一作者所写的任务。传统上该分析由考虑语言特征的专家执行,例如包括拼写错误、语法不一致和文体特征。另一方面,机器学习算法可被训练以完成相同任务,但传统上依赖于所谓的文体测量特征。此类特征的劣势在于,对于短小且主题多变的社交媒体文本,其可靠性大幅降低。在这项跨学科工作中,我们提出了对近期发表的分层连体神经网络方法的实质性扩展,借此可学习神经特征并可视化决策过程。为此,我们编译了一个用于文本比对研究的短亚马逊评论大规模新语料库,并展示连体网络拓扑优于基于文体测量特征构建的最先进方法。我们对网络内部注意力权重的语言学分析表明,所提方法确实能够捕捉到一些传统语言学范畴。
引用
@article{arxiv.1910.08144,
title = {Explainable Authorship Verification in Social Media via Attention-based Similarity Learning},
author = {Benedikt Boenninghoff and Steffen Hessler and Dorothea Kolossa and Robert M. Nickel},
journal= {arXiv preprint arXiv:1910.08144},
year = {2019}
}
备注
Accepted for 2019 IEEE International Conference on Big Data (IEEE Big Data 2019)