潜在语义空间中短文本作者聚类的框架
计算与语言
2020-12-01 v1 人工智能
机器学习
摘要
作者聚类是指在没有任何作者写作风格或主题偏好的先验正例的情况下,将由同一作者或作者团队撰写的文档进行分组。对于较短文本(通常短于常规文档的段落长度文本)上的作者聚类,文档表示尤为重要:非常高维的特征空间会导致数据稀疏并遭受如维数灾难等严重后果,而特征选择可能导致信息损失。我们提出了一个高层框架,其利用通过非参数主题建模导出的潜在特征空间中的紧凑数据表示。此后在两种情景下识别作者簇:(a) 完全无监督,以及 (b) 半监督,其中少量较短文本已知属于同一作者(必连约束)或不属于(勿连约束)。我们报告了在三种语言和两种体裁的 120 个集合上的实验,并表明基于主题的潜在特征空间提供了有前景的性能水平,同时与现有最优方法相比将维数降低了 1500 倍。我们还证明,虽然关于作者(即作者簇)精确数量的先验知识对额外质量贡献不大,但关于作者簇成员关系的少量约束知识在这一困难任务面前带来了明显的性能提升。使用标准指标的详尽实验表明,作者聚类尤其针对较短文本仍有充分的改进空间。
引用
@article{arxiv.2011.15038,
title = {A Framework for Authorial Clustering of Shorter Texts in Latent Semantic Spaces},
author = {Rafi Trad and Myra Spiliopoulou},
journal= {arXiv preprint arXiv:2011.15038},
year = {2020}
}
备注
8 pages including references