中文

大语言模型在低资源语言中能否忠实地自我解释?——以波斯语情感检测为例

计算与语言 2025-11-26 v1

摘要

大语言模型(LLMs)越来越常用于生成与预测相关的自我解释,这一做法引发了关于这些解释忠诚性的担忧,尤其是在低资源语言中更为突出。本研究聚焦于波斯语情感分类这一低资源语言情境,评估 LLM 生成的解释的忠诚性,通过将模型识别的有影响力词与人工标注者识别的词进行比较。我们采用源自 token 级对数概率的置信度分数来评估忠诚性。测试两种提示策略,即预测后解释(Predict-then-Explain)和解释后预测(Explain-then-Predict),以评估其对解释忠诚性的影响。我们的结果显示,尽管 LLM 达到了强大的分类性能,但其生成的解释常常与忠实推理不符,显示出与人类判断更大程度的一致性。这些结果凸显了当前解释方法和指标的局限性,强调需要更稳健的方法以确保 LLM 在多语言和低资源情境下的可靠性。

关键词

引用

@article{arxiv.2511.19719,
  title  = {Can LLMs Faithfully Explain Themselves in Low-Resource Languages? A Case Study on Emotion Detection in Persian},
  author = {Mobina Mehrazar and Mohammad Amin Yousefi and Parisa Abolfath Beygi and Behnam Bahrak},
  journal= {arXiv preprint arXiv:2511.19719},
  year   = {2025}
}