中文

MixEval-X:基于真实世界数据混合的任意模态评估

人工智能 2024-10-21 v2 机器学习 多媒体

摘要

感知和生成多样化模态是 AI 模型有效学习和与真实世界信号互动的关键要求,因此需要可靠的评估方法以指导其发展。我们指出当前评估存在两个主要问题:(1) 标准不一致,受制于不同社区的协议差异和成熟度不同;(2) 查询方式、评分标准及泛化能力存在显著偏差。为此,我们提出 MixEval-X——首个支持任意模态输入输出的、基于真实世界数据混合的综合评估基准,旨在跨多种输入输出模态优化和标准化评估流程。我们引入多模态基准混合策略,并设计适应-纠正管道以重构真实世界任务分布,确保评估在实际应用场景中具备良好泛化能力。大规模元评估表明,我们的方法能有效将基准样本与真实世界任务分布对齐。此外,MixEval-X 的模型排名与众包真实世界评估结果高度相关(相关系数最高达 0.98),且效率更高。我们提供完整的排行榜,对现有模型和机构进行重新排序,并提供洞察,增强对多模态评估的理解,为未来研究提供指导。

关键词

引用

@article{arxiv.2410.13754,
  title  = {MixEval-X: Any-to-Any Evaluations from Real-World Data Mixtures},
  author = {Jinjie Ni and Yifan Song and Deepanway Ghosal and Bo Li and David Junhao Zhang and Xiang Yue and Fuzhao Xue and Zian Zheng and Kaichen Zhang and Mahir Shah and Kabir Jain and Yang You and Michael Shieh},
  journal= {arXiv preprint arXiv:2410.13754},
  year   = {2024}
}