基于分层最优传输的日本汉字间距离映射
统计方法学
2023-04-06 v1 应用统计
摘要
我们引入一个通用框架,用于依据汉字间的相异度赋予其距离。该术语的具体含义可能取决于实际应用。我们唯一的假设是:两个汉字的相异度可充分表达为以最优方式匹配组件嵌套结构所得惩罚的加权均值。对于匹配代价,我们提出若干可自由组合或替换为其他模块的组件,包括配准组件间相对非平衡墨迹传输、配准所需变换间的距离,以及预指定标签的差异。作为概念验证,我们给出了以此方式获得的汉字距离函数的具体示例。基于该函数,我们通过多维缩放生成了二维汉字映射,以及含16个最近邻的100个随机选取的常用汉字(Jōyō kanji)表。我们的汉字距离函数可帮助非CJK背景的日语学习者掌握汉字读写,此外还可协助汉字词典编辑呈现材料,并可用于文本处理与光学字符识别系统中评估错误可能性。
引用
@article{arxiv.2304.02493,
title = {Distance maps between Japanese kanji characters based on hierarchical optimal transport},
author = {Dominic Schuhmacher},
journal= {arXiv preprint arXiv:2304.02493},
year = {2023}
}
备注
24 pages, 5 figures