捕捉作者与文档表示中的写作风格
计算与语言
2025-06-27 v2 机器学习
摘要
深度自然语言处理 (NLP) 模型广泛整合了单词和文档的连续、低维表示。然而,很少有模型致力于为作者学习表示。这些表示可用于诸多 NLP 任务,如作者识别和分类,或在推荐系统中。现有工作的一个强限制是未显式捕捉写作风格,使其难以应用于文学数据。因此,我们提出一种基于变分信息瓶颈 (VIB) 的新型架构,用于学习作者和文档的嵌入,并引入写作风格约束。我们的模型对预训练的文档编码器进行微调。通过添加预定义的风格特征,我们刺激对写作风格的检测,从而使表示轴可解释,尤其关注写作风格指示器。我们在三个数据集上进行评估:从 Gutenberg 项目提取的文学语料库、Blog Authorship Corpus 和 IMDb62。我们展示的方法在作者归属方面不仅匹配或优于强大的/最新基线,还能更准确地捕捉作者的写作风格方面的特征。
引用
@article{arxiv.2407.13358,
title = {Capturing Style in Author and Document Representation},
author = {Enzo Terreau and Antoine Gourru and Julien Velcin},
journal= {arXiv preprint arXiv:2407.13358},
year = {2025}
}