意见摘要中意见普遍性的自动评估
计算与语言
2023-07-27 v1
摘要
面对大量产品评论时,人类能否记住所有评论并具代表性地权衡意见以写出良好的参考摘要并不明确。我们提出一种自动度量,用于检验摘要所表达意见的普遍性,其基于统计与摘要中每条陈述一致的评论数量,同时贬抑琐碎或冗余的陈述。为构建该意见普遍性度量,我们考虑了多种现有方法来为摘要陈述相对于每条独立源评论的事实一致性打分。在 Amazon 产品评论语料库上,我们收集了多个人类关于意见一致性的判断,以确定哪种自动度量最能表达产品评论中的一致性。使用所得意见普遍性度量,我们表明人工撰写的摘要其意见普遍性仅略优于从源评论中随机选取的摘录,而此前的抽取式与生成式无监督意见摘要方法表现不如人类。我们通过贪心构建抽取式摘要展示了改进空间,其意见普遍性达到人类的两倍。最后,我们表明通过简化对源评论的预处理,可将现有生成式意见摘要系统所实现的意见普遍性提升至人类水平。
引用
@article{arxiv.2307.14305,
title = {Automatically Evaluating Opinion Prevalence in Opinion Summarization},
author = {Christopher Malon},
journal= {arXiv preprint arXiv:2307.14305},
year = {2023}
}
备注
The 6th Workshop on e-Commerce and NLP (KDD 2023)