评估句子级流畅度的无监督方法:我们真的需要参考文本吗?
计算与语言
2023-12-05 v1
摘要
流畅度是所有自然语言生成(NLG)系统的一个关键目标。广泛使用的自动评估指标在捕捉机器生成文本的流畅度方面存在不足。评估 NLG 系统的流畅度是一个挑战,因为这些模型不仅限于简单地重用输入中的词汇,还可能生成抽象内容。现有的基于参考的流畅度评估方法(如词汇重叠度量)通常与人类判断的相关性较弱。本文改编了一种现有的无监督技术,用于在不需要任何参考的情况下衡量文本流畅度。我们的方法利用各种词嵌入,并使用循环神经网络(RNN)架构训练语言模型。我们还尝试了其他可用的多语言语言模型(LM)。为了评估模型的性能,我们在 10 种印度语系语言中进行了比较分析,将获得的流畅度分数与人类判断相关联。我们的代码和用于流畅度评估的人工标注基准测试集可在 https://github.com/AnanyaCoder/TextFluencyForIndicLanagues 获取。
引用
@article{arxiv.2312.01500,
title = {Unsupervised Approach to Evaluate Sentence-Level Fluency: Do We Really Need Reference?},
author = {Gopichand Kanumolu and Lokesh Madasu and Pavan Baswani and Ananya Mukherjee and Manish Shrivastava},
journal= {arXiv preprint arXiv:2312.01500},
year = {2023}
}
备注
Accepted at IJCNLP-AACL SEALP Workshop