Symphonym:面向跨书写系统专名匹配的通用音素嵌入
计算与语言
2026-03-31 v4 人工智能
摘要
跨书写系统匹配地名是整合多语言地理信息源(包括现代地名词库、中世纪行程记录或殖民时期调查)时 persistent 挑战。现有方法依赖语言特定的音素算法或罗马化步骤,丢失音素信息且无法跨书写系统泛化。本文提出 Symphonym,一个神经嵌入系统,将二十种书写系统的地名映射到统一的 128 维音素空间,实现跨书写系统的直接相似度比较,无需语言识别或音素资源。采用 Teacher-Student 知识蒸馏架构,先从 IPA 音标转录中学习语音发音特征,再将知识迁移至字符级 Student 模型。基于 GeoNames、Wikidata 和 Getty 地理名称教科书的 6700 万地名(3270 万三元组样本)训练,Student 在 MEHDIE 跨书写基准上实现 Recall@1 最高(85.2%)和 Mean Reciprocal Rank 最高(90.8%),该基准由领域专家精选的中世纪希伯来文和阿拉伯文地名匹配样本,且完全独立于训练数据,展示了从现代训练材料到古籍资料的跨时代泛化能力。仅用原始语音特征的消融实验仅达 45.0% MRR,确认了神经训练课程的贡献。该方法自然处理历史文献中非标准化的orthographic 变体,并能有效迁移至档案资料中的人名,表明其在数字人文和联合开放数据语境下的宽泛适用性。
引用
@article{arxiv.2601.06932,
title = {Symphonym: Universal Phonetic Embeddings for Cross-Script Name Matching},
author = {Stephen Gadd},
journal= {arXiv preprint arXiv:2601.06932},
year = {2026}
}
备注
19 pages, 3 tables