印度文明符号系统是否非语言化?——基于合成基准的评估记分卡
计算与语言
2026-04-21 v1
摘要
印度文明符号系统(约公元前2600年-1900年)是否编码语言存在数十年之争。本文引入一种多指标判别框架,用于测试观察到的印度语料库是否符合两种计算机生成的非语言基准——一种模拟徽标符号系统,另一种模拟行政编码系统——每种基准均采用赫芬鲁克频率分布、位置约束和来自六个已证实非语言语料库的双元依赖进行校准。评分卡评估四个关键属性:文本简短性、重复公式化短语、hapax legomenon 比率和位置刚性。将该框架应用于ICIT/Yajnadevam 数字化的1916个去重碑文(584个唯一符号,11110个标记),我们发现印度语料库未能干净匹配任一基准。跨四项指标,印度语料库处于两种基准家族之间的中间位置,既不匹配徽标符号系统,也不匹配行政编码系统。徽标或行政生成器均无法同时再现所有四项属性。我们还与七个真实世界非语言语料库进行比较,发现无一已证实的非语言系统能够再现印度统计配置的全部特征。我们复制了关键的先前结果,包括赫芬鲁克斜率为 -1.49 和条件熵为 3.23 位。所有代码和数据均公开可用。
引用
@article{arxiv.2604.17828,
title = {How Non-Linguistic Is the Indus Sign System? A Synthetic-Baseline Scorecard},
author = {Ashish Nair},
journal= {arXiv preprint arXiv:2604.17828},
year = {2026}
}
备注
13 pages, 4 figures, 8 tables. Code available from corresponding author upon request