3000个中文感知运动与具身化规范
计算与语言
2026-05-29 v2
摘要
理解概念知识如何在身体经验中得到 grounding,以及机器系统在无直接感知运动经验的情况下是否能获得此类知识,是认知科学和具身人工智能研究中的核心问题。大规模规范资源对于经验性地检验这些问题至关重要,但此类资源在非Indo-European语言中仍稀缺。我们提出了一个涵盖3000个中文词汇化概念的新型规范数据库,包含11维感知运动评分和单维具身化评分,来自378名母语中文使用者。这些评分表现出高可靠性,并与现有中文资源在跨规范有效性方面表现良好,而这些资源每个覆盖的词汇数量有限且仅覆盖11个感知运动维度中的子集。在验证研究中,我们在词汇决策任务中测试了从理论驱动的度量指标派生的新变量,即具身感知强度(PSE)(Huang等,2025),以及七个常见复合变量。结果表明,PSE-感知运动和Minkowski-3是最强的复合预测器,捕捉了感知运动信息对词汇处理的促进效应。进一步的探索性研究显示,感知运动评分可通过简单的回归模型从纯语言表示中恢复(各维度平均Spearman r = .62),但恢复程度差异显著:视觉和听觉维度的对应性高于化学感受维度。表示相似性分析进一步表明,感知运动空间的关系几何也可部分恢复(r = .540),这与分布式语言使用编码构象概念结构的部分方面相一致。
引用
@article{arxiv.2605.22616,
title = {Chinese sensorimotor and embodiment norms for 3,000 lexicalized concepts},
author = {Jing Chen and Gábor Parti and Yin Zhong and Chu-Ren Huang and Marco Marelli},
journal= {arXiv preprint arXiv:2605.22616},
year = {2026}
}