面向生成式 AI 的类人内容分析:基于语言导向的稀疏编码器
计算机视觉与模式识别
2026-04-23 v4
摘要
生成式 AI 的快速发展已彻底改变内容创作、沟通与人类发展,但这一技术在高风险领域引发了深刻关切,亟需严谨的方法来分析和评估 AI 生成的内容。虽然现有分析方法常将图像视为不可分割的整体,但真实世界的 AI 故障通常表现为特定的视觉模式,这些模式可被整体检测所漏检,且更适合进行细粒度和分解式分析。我们引入了内容分析工具 Language-Grounded Sparse Encoders (LanSE),其将图像分解为具有自然语言描述的可解释视觉模式。利用可解释性模块和大型多模态模型,LanSE 能够自动识别数据模态中的视觉模式。我们的方法发现超过 5,000 个视觉模式,人类一致性达93%,提供的分解评估超越现有方法,建立了对物理合理性的首个系统评估,并扩展至医学影像领域。我们方法从语言导向模式中提取的能力可自然适用于诸多领域,包括生物学和地理学,以及其他数据模态如蛋白质结构和时间序列,从而推动生成式 AI 的内容分析。
引用
@article{arxiv.2508.18236,
title = {Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders},
author = {Yiming Tang and Arash Lagzian and Srinivas Anumasa and Qiran Zou and Yingtao Zhu and Ye Zhang and Trang Nguyen and Yih-Chung Tham and Ehsan Adeli and Ching-Yu Cheng and Yilun Du and Dianbo Liu},
journal= {arXiv preprint arXiv:2508.18236},
year = {2026}
}