用于视觉对话的MRR与NDCG模型集成
人工智能
2021-08-05 v3 计算与语言
计算机视觉与模式识别
信息检索
机器学习
摘要
评估一个能用人类语言对话并理解视觉内容的AI智能体具有挑战性。生成式指标(如BLEU分数)偏好正确句法而非语义。因此常采用判别式方法,由智能体对一组候选选项排序。平均倒数排名(MRR)指标通过考虑单个人类给出答案的排名来评估模型性能。然而,这种方法带来了新挑战:答案的模糊性与同义性,例如语义等价(如‘yeah’与‘yes’)。为此,归一化折损累计增益(NDCG)指标被用于通过密集标注捕捉所有正确答案的相关性。但NDCG指标偏好通常适用的不确定答案,如‘我不知道’。构建一个在MRR与NDCG指标上均表现出色的模型具有挑战性。理想情况下,AI智能体应给出类人回复并验证任意答案的正确性。为解决此问题,我们描述了一种可融合强MRR与NDCG模型的两步非参数排序方法。使用我们的方法,我们得以保持大部分MRR最优性能(70.41%对71.24%)与NDCG最优性能(72.16%对75.35%)。此外,我们的方法赢得了近期的Visual Dialog 2020挑战赛。源代码见https://github.com/idansc/mrr-ndcg。
引用
@article{arxiv.2104.07511,
title = {Ensemble of MRR and NDCG models for Visual Dialog},
author = {Idan Schwartz},
journal= {arXiv preprint arXiv:2104.07511},
year = {2021}
}
备注
Accepted to NAACL2021