中文

变分自编码器视觉模型中字母身份与字母位置的解耦与组合性

计算机视觉与模式识别 2024-12-17 v1 人工智能

摘要

人类读者能够准确计数单词中包含的字母数量(例如,"buffalo"中有7个字母),移除指定位置的字母(例如,"bufflo"),或添加一个新字母。因此,人类大脑中的阅读者必须已经学习了如何解耦与字母位置相关的信息与字母身份相关的信息。这种解耦是人类在具有任意字母组合、任意位置出现于新字符串中的情况下创建和解析单词所必需的组合能力的关键。现代深度神经网络模型是否也具备这种关键组合能力?我们测试了实现视觉输入特征解耦的最先进神经模型是否也能在训练书写单词图像时解耦字母位置和字母身份。具体而言,我们训练了一个 beta 变分自编码器(β\beta-VAE)来重建字母字符串的图像,并使用我们为研究视觉模型中组合学习和零样本泛化而创建的新基准测试(CompOrth)评估其解耦性能。该基准建议一组日益复杂的测试,以评估深度神经模型在书写单词语义特征方面的解耦程度。使用 CompOrth,我们进行了一系列实验来分析这些模型的泛化能力,特别是针对未见过的单词长度以及未见过的字母身份与字母位置的组合。我们发现,尽管模型有效地解耦了表面特征,例如单词在图像中的水平和垂直"视网膜"位置,但它们在解耦字母位置和字母身份方面大幌失败,缺乏对单词长度的任何概念。该研究表明,与人类相比,当前最先进的 β\beta-VAE 模型存在不足,并提出了新的挑战和相应的基准测试来评估神经网络模型。

关键词

引用

@article{arxiv.2412.10446,
  title  = {Disentanglement and Compositionality of Letter Identity and Letter Position in Variational Auto-Encoder Vision Models},
  author = {Bruno Bianchi and Aakash Agrawal and Stanislas Dehaene and Emmanuel Chemla and Yair Lakretz},
  journal= {arXiv preprint arXiv:2412.10446},
  year   = {2024}
}