微博中主题连贯性的评估
计算与语言
2021-07-01 v1
摘要
将代表同一时间段内相同话题观点的微博聚集在一起,对许多不同任务和实践者都很有用。一个主要问题是如何评估此类主题簇的质量。在此,我们创建了来自三个不同领域和时间窗口的微博簇语料库,并定义了评估主题连贯性的任务。我们提供了标注指南以及记者专家对主题连贯性的人工标注。随后,我们考察了不同自动评估指标在该任务上的效能。我们考虑了一系列指标,包括表层指标、主题模型连贯性指标和文本生成指标(TGMs)。虽然表层指标表现良好,优于主题连贯性指标,但它们不如 TGMs 一致。TGMs 由于对时间窗口效应较不敏感,比所有其他考虑的指标都更可靠地捕捉微博簇中的主题连贯性。
引用
@article{arxiv.2106.15971,
title = {Evaluation of Thematic Coherence in Microblogs},
author = {Iman Munire Bilal and Bo Wang and Maria Liakata and Rob Procter and Adam Tsakalidis},
journal= {arXiv preprint arXiv:2106.15971},
year = {2021}
}
备注
ACL 2021 - Long Paper - Association for Computational Linguistics