中文

面向 AI 时代的力概念鉴定工具翻译研究

物理教育 2025-08-20 v1

摘要

我们 presented a研究,将力概念鉴定工具(Force Concept Inventory, FCI)使用 OpenAI GPT-4o 进行翻译,并评估了使用大语言模型(LLM)翻译科学主题的具体困难。FCI 是一份物理考试,旨在评估学生在牛顿力学教学前后所获成果。我们检验了 LLM 在翻译文档以及将翻译结果译回英文后的问题解决能力,详细阐述了语言依赖性问题如何 complicating the translation。虽然 ChatGPT 在翻译后的语言以及译回英文后都表现出色,但问题仍然存在于语言特定的细微差别和格式方面。其中的陷阱包括缺乏单向匹配术语的词语或短语,尤其是学科特定的科学术语,或是 outright 错误的翻译。根据语境,这些翻译可能导致物理含义发生关键性改变。此外,还发现问题编号和字母编号在某些语言中的问题。在翻译编号和字母编号方面的问题为我们提供了关于 LLM 能力的见解,并表明其并非仅仅依赖 FCI 问题——这些问题可能已是 LLM 训练数据的一部分——来提供答案。这些发现表明,尽管 LLM 可以加速教育工具的多语言获取,但仍需谨慎审阅以确保翻译评估的忠实性和清晰度。LLM 为扩大教育工具和评估提供了新的机遇。同时,使用 LLM 来促进翻译也存在独特挑战,这一案例研究详细探讨了这些挑战。

关键词

引用

@article{arxiv.2508.13908,
  title  = {Translating the Force Concept Inventory in the age of AI},
  author = {Marina Babayeva and Justin Dunlap and Marie Snětinová and Ralf Widenhorn},
  journal= {arXiv preprint arXiv:2508.13908},
  year   = {2025}
}