语义答案相似度度量评估
计算与语言
2022-07-06 v2 人工智能
机器学习
摘要
现有的通用机器翻译或自然语言生成评估度量存在若干问题,而问答(QA)系统在此背景下亦不例外。为构建鲁棒 QA 系统,我们需要具备同等鲁棒的评估系统以验证模型对问题的预测是否与真值标注相似。基于语义而非纯字符串重叠来比较相似度的能力,对于公平比较模型以及在真实应用中给出更现实的接受标准十分重要。我们基于据我们所知首篇使用基于 transformer 的模型度量来评估语义答案相似度的论文,并在无词汇重叠情形下取得更高的人类判断相关性。我们提出了用于语义答案相似度的交叉编码器增强双编码器与 BERTScore 模型,其训练采用了一个由美国公众人物姓名对构成的新数据集。就我们所知,我们提供了首个共指姓名字符串对及其相似度的数据集,可用于训练。
引用
@article{arxiv.2206.12664,
title = {Evaluation of Semantic Answer Similarity Metrics},
author = {Farida Mustafazade and Peter F. Ebbinghaus},
journal= {arXiv preprint arXiv:2206.12664},
year = {2022}
}
备注
3rd International Conference on NLP & Big Data (NLPD 2022), 4th International Conference on Machine Learning & Applications (CMLA 2022)