具有与不具有视觉基础神经模型中的个体化
计算与语言
2024-09-30 v1 人工智能
机器学习
摘要
我们展示了语言-视觉模型 CLIP 与两个纯文本模型——FastText 和 SBERT——在个体化信息编码方面的差异。我们研究了 CLIP 为基底、颗粒聚集物以及不同数量物体提供的潜在表示。我们证明,与在纯文本数据上训练的模型相比,CLIP 嵌入能更好地捕捉个体化的数量差异。此外,我们从 CLIP 嵌入中推导出的个体化层级与语言学和认知科学中提出的层级相一致。
引用
@article{arxiv.2409.18868,
title = {Individuation in Neural Models with and without Visual Grounding},
author = {Alexey Tikhonov and Lisa Bylinina and Ivan P. Yamshchikov},
journal= {arXiv preprint arXiv:2409.18868},
year = {2024}
}