中文

我的模型为何失败?基于Matryoshka转译器的物理合理性失效模式自动识别与解释

机器学习 2025-11-19 v2 计算机视觉与模式识别

摘要

尽管最近的生成模型在生成指令遵循和逼真的输出方面表现出色,但它们仍然容易出现显著的物理合理性失效。虽然这些物理合理性错误在应用中至关重要,但往往被现有的评估方法所忽视。此外,尚无框架存在,用于自动识别和解释自然语言中的具体物理错误模式,从而阻碍了针对性模型改进。我们提出Matryoshka转译器(Matryoshka Transcoders),一种用于自动发现和解释生成模型中物理合理性特征的新框架。我们的方法将Matryoshka表示学习范式扩展到转译器架构中,实现了在多个粒度级别上的层次化稀疏特征学习。通过在物理合理性分类器的中间表示上进行训练,并利用大型多模态模型进行解释,我们的方法在无需手动特征工程的情况下识别了多样化的物理相关失效模式,实现了优于现有方法的更佳特征相关性和特征准确率。我们利用所发现的视觉模式为评估生成模型中的物理合理性建立基准。我们对八个最先进的生成模型进行分析,为这些模型未遵循物理约束的方式提供了宝贵见解,为进一步模型改进铺平了道路。

关键词

引用

@article{arxiv.2511.10094,
  title  = {How does My Model Fail? Automatic Identification and Interpretation of Physical Plausibility Failure Modes with Matryoshka Transcoders},
  author = {Yiming Tang and Abhijeet Sinha and Dianbo Liu},
  journal= {arXiv preprint arXiv:2511.10094},
  year   = {2025}
}