中文

基于AI的标志性语言分类用于语言景观研究

机器学习 2025-10-28 v1

摘要

语言景观(LL)研究传统上依赖人工摄影和标注公共标志以检验城市空间中语言的分布。虽然此类方法产出宝贵发现,但过程耗时且难以覆盖大范围研究区域。本研究探讨使用AI驱动语言检测方法自动化LL分析。以檀香山唐人街为案例研究,我们构建了包含1,449张图片的地理标记数据集,由研究人员收集,并应用AI进行光学字符识别(OCR)和语言分类。我们还进行了手动验证以进行准确性检查。该模型实现了79%的总体准确率。识别出五类常见的误标类型,包括畸变、反射、受损表面、涂鸦和幻觉。分析还显示,AI模型会平等对待图像中的各个区域,检测人类解释者通常忽略的边缘或背景文本。尽管存在上述局限性和误标,但结果表明将AI辅助工作流程整合到LL研究中具有潜力,以减少此类耗时的进程。然而,鉴于所有局限性和误标,我们认识到AI在此过程中无法被完全信赖。这篇论文鼓励采用结合AI自动化与人类验证的混合方法,以实现更可靠且更高效的工作流程。

关键词

引用

@article{arxiv.2510.22885,
  title  = {AI based signage classification for linguistic landscape studies},
  author = {Yuqin Jiang and Song Jiang and Jacob Algrim and Trevor Harms and Maxwell Koenen and Xinya Lan and Xingyu Li and Chun-Han Lin and Jia Liu and Jiayang Sun and Henry Zenger},
  journal= {arXiv preprint arXiv:2510.22885},
  year   = {2025}
}