中文

基于语音转写的 CUDA 并行 Needleman-Wunsch 算法用于计算词语相似度

计算与语言 2025-09-03 v1

摘要

我们提出了一种基于词语语音转写(其发音)计算词语相似度的方法, 使用Needleman-Wunsch算法。我们将该算法在Rust中实现, 并在CPU和GPU上进行并行化, 以高效处理大型数据集。GPU实现利用CUDA和cudarc Rust库, 实现显著的性能提升。我们通过构建一个节点表示词语、边根据词语间相似度赋予权重的完全连接图来验证我们的方法。该图随后被分析用于识别相似发音词语的群组。我们的结果表明, 该方法在分析语言语音结构方面具有可行性和有效性。它可能容易扩展到其他语言。

关键词

引用

@article{arxiv.2509.01654,
  title  = {Parallel Needleman-Wunsch on CUDA to measure word similarity based on phonetic transcriptions},
  author = {Dominic Plein},
  journal= {arXiv preprint arXiv:2509.01654},
  year   = {2025}
}

备注

11 pages, 12 figures, accompanied by a YouTube video (https://youtu.be/xbcpnItE3_4) and a GitHub repository (https://github.com/Splines/phonetics-graph/)