中文

从对比到自监督:脚本相似性学习的两阶段框架

计算机视觉与模式识别 2026-03-09 v1 人工智能 计算与语言 机器学习

摘要

学习字形和书写系统的相似性度量面临根本性挑战:虽然单个谬误字母在人造字母表中可以可靠标记,但不同书写系统之间的历史关系仍不确定且争议。我们提出一个两阶段框架以解决此认识论约束。首先,我们在标记的人造字母表上使用对比损失训练编码器,构建具备鲁棒判别特征的教师模型。其次,通过教师-学生蒸馏将其扩展到历史记载的书写系统,学生在教师知识指导下学习无监督表示,但自由发现跨书写系统的潜在相似性。非对称设置使学生能够学习变形不变的嵌入,同时继承来自干净示例的判别结构。我们的框架桥接了监督对比学习和无监督发现,使我们能够实现不同系统之间的硬边界,以及反映潜在历史影响的软相似性。实验在多样化书写系统上表明,在不要求 ground-truth 进化关系的情况下,实现有效的 few-shot 字形识别和有意义的脚本聚类。

关键词

引用

@article{arxiv.2603.06180,
  title  = {Contrastive-to-Self-Supervised: A Two-Stage Framework for Script Similarity Learning},
  author = {Claire Roman and Philippe Meyer},
  journal= {arXiv preprint arXiv:2603.06180},
  year   = {2026}
}