SACRED:面向在线精神疗愈中连贯性类型分类的忠实标注多媒体多模态多语言数据集
计算与语言
2026-03-31 v1 多媒体
摘要
在宗教与神学研究中,精神疗愈因超越文化并为个体提供独特体验,已引起大量研究关注。然而,社会科学家常依赖有限数据集,且这些数据在线上基本不可得。本研究与社会科学家合作,构建了高质量的多媒体多模态数据集SACRED,确保分类的忠实性。使用SACRED,我们评估了13个流行大语言模型(LLM)以及传统规则方法和微调方法的性能。结果表明,DeepSeek-V3模型在分类此类抽象概念方面表现良好(在Quora测试集中达到79.19%准确率),而GPT-4o-mini模型在视觉任务中超越其他模型(63.99% F1分数)。据此推断,这是首个来自在线精神疗愈交流的标注多模态数据集。我们的研究还发现一种新型的连贯性类型,对通信科学研究具有重要价值。
引用
@article{arxiv.2603.27331,
title = {SACRED: A Faithful Annotated Multimedia Multimodal Multilingual Dataset for Classifying Connectedness Types in Online Spirituality},
author = {Qinghao Guan and Yuchen Pan and Donghao Li and Zishi Zhang and Yiyang Chen and Lu Li and Flaminia Canu and Emilia Volkart and Gerold Schneider},
journal= {arXiv preprint arXiv:2603.27331},
year = {2026}
}
备注
Accepted by LLMs4SSH 2026 at LREC