大语言模型在不同规模与任务下情感安全分类的缩放行为
计算与语言
2025-09-08 v1 机器学习
摘要
理解大语言模型(LLM)如何处理情感敏感内容对于构建安全可靠的系统至关重要,尤其是在心理健康领域。我们研究了 LLM 在两个关键任务上的缩放行为:情感安全的三元分类(安全、不安全与临界)以及使用六类安全风险分类法的多标签分类。为了支持这一研究,我们通过合并几个人工编写的心理健康数据集(> 15K 样本)并使用 ChatGPT 生成的情感重新解释提示对其进行增强,构建了一个新颖的数据集。我们在零样本、少样本和微调设置下评估了四个 LLaMA 模型(1B、3B、8B、70B)。结果表明,更大的 LLM 取得了更强的平均性能,特别是在需要细致辨别的多标签分类和零样本设置中。然而,轻量级微调使得 1B 模型在几个高数据量类别中取得了与更大模型及 BERT 相当的性能,同时推理时仅需 <2GB 的 VRAM。这些发现表明,更小的端侧模型可以作为敏感应用的可行的、保护隐私的替代方案,提供解释情感语境并维持安全对话边界的能力。这项工作突出了对治疗性 LLM 应用和安全关键系统可扩展对齐的关键启示。
引用
@article{arxiv.2509.04512,
title = {Scaling behavior of large language models in emotional safety classification across sizes and tasks},
author = {Edoardo Pinzuti and Oliver Tüscher and André Ferreira Castro},
journal= {arXiv preprint arXiv:2509.04512},
year = {2025}
}