中文

将眼动信号融入多模态深度视觉模型以预测住宅空间的用户审美体验

计算机视觉与模式识别 2026-01-26 v1 人工智能

摘要

理解人们如何感知和评估室内空间对于设计促进福祉的环境至关重要。然而,由于感知的主观性质以及视觉反应的复杂性,预测审美体验仍然具有挑战性。本研究引入一个双分支 CNN-LSTM 框架,将视觉特征与眼动信号融合,以预测住宅室内的审美评估。我们收集了 224 个室内设计视频,配有来自 28 名参与者的同步注视数据,他们对 15 个审美维度进行评估。该模型在客观维度(如光照)上达到 72.2% 的准确率,在主观维度(如放松)上达到 66.8% 的准确率,超越了最先进的视频基线方法,在主观评估任务上显示出明显的提升。值得注意的是,训练时使用眼动信号的模型在仅部署视觉输入时仍能保持相当的性能。消融实验进一步表明,瞳孔反应对客观评估贡献最大,而注视与视觉线索的组合增强了主观评估。这些发现凸显了在训练时引入眼动作为特权信息的价值,使我们能够为室内设计中的审美评估构建更实用的工具。

关键词

引用

@article{arxiv.2601.16811,
  title  = {Incorporating Eye-Tracking Signals Into Multimodal Deep Visual Models For Predicting User Aesthetic Experience In Residential Interiors},
  author = {Chen-Ying Chien and Po-Chih Kuo},
  journal= {arXiv preprint arXiv:2601.16811},
  year   = {2026}
}