中文

无监督跨语言分词的超参数自调优

计算与语言 2023-04-05 v2 人工智能

摘要

我们探索了针对英语、俄语和汉语的与语言无关的无监督分词问题进行元学习的可能性。我们实现了早前工作中提出的无监督分词模型超参数的元学习自动确定方法,该方法依赖于各种独立于人类的适应度函数,如归一化反熵、压缩因子和交叉分割 F1 分数,以及这三种度量的加性和乘性复合组合,并以常规的 F1 分词分数作为对照进行测试。我们发现,对于英语和俄语,后者与前三种度量的加性组合之间存在相当好的相关性。对于汉语,我们发现 F1 分数与压缩因子之间存在显著相关性。我们的结果表明了低资源语言和死语言鲁棒无监督分词的可能性,并使我们能够从在不同人类文化中演化出的具有不同结构优化方案的高效符号通信代码的演化角度来思考人类语言。

关键词

引用

@article{arxiv.2303.02427,
  title  = {Self-tuning hyper-parameters for unsupervised cross-lingual tokenization},
  author = {Anton Kolonin},
  journal= {arXiv preprint arXiv:2303.02427},
  year   = {2023}
}

备注

5 figures, 2 tables, submitted to KONT-2023 conference