中文

具象智能的数据评估

机器人学 2025-11-13 v1

摘要

在具象智能领域,数据集在作为知识储存库和信息传递媒介方面发挥着关键作用。数据集最关键的两个属性是所包含信息量以及模型易于学习的程度。然而,具象数据的多模态特性使得评估这些属性尤为具有挑战性。先前的研究主要聚焦于多样性,通常通过计数任务与场景或评估单一模态来衡量,无法提供数据集多样性的全面图景。另一方面,数据集的可学习性受到了很少的关注,通常通过模型训练后置评估,此过程代价高昂且耗时,且缺乏可解释性,无法提供改进数据集的指导。本文通过引入两个原则性、数据驱动的工具来解决上述两个挑战。首先,我们构建每个数据样本的统一多模态表示,基于此提出多样性熵—a种连续性度量,刻画数据集所包含信息量。其次,我们引入首个可解释、数据驱动的算法,高效量化数据集的可学习性,而无需进行训练,使研究人员在数据集发布时即可立即评估其可学习性。我们在模拟数据集和真实数据集上对该算法进行验证,表明其产生的洞察信息忠实可靠且可操作,使研究人员能够联合改进多样性和可学习性。我们希望本工作为设计更高质量的数据集、推动具象智能发展提供基础。

关键词

引用

@article{arxiv.2511.09119,
  title  = {Data Assessment for Embodied Intelligence},
  author = {Jiahao Xiao and Bowen Yan and Jianbo Zhang and Jia Wang and Chunyi Li and Zhengxue Cheng and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2511.09119},
  year   = {2025}
}