From Perceptions To Evidence: Detecting AI-Generated Content In Turkish News Media With A Fine-Tuned Bert Classifier
计算与语言
2026-02-17 v1 人工智能
摘要
大型语言模型快速融入新闻编辑室工作流程,引发了关于在线媒体中 AI 生成内容普遍性的紧迫问题。虽然计算研究已开始量化英语媒体中的这一现象,但尚无针对土耳其新闻媒体的实证调查,现有研究仍局限于对记者的定性访谈或假新闻检测。本研究通过微调一个针对土耳其语的 BERT 模型(dbmdz/bert-base-turkish-cased),在一个包含来自三家具有不同编辑导向的土耳其主要媒体的 3,600 篇文章的标注数据集上进行 AI 改写内容的二分类,来填补这一空白。该模型在保留测试集上达到了 0.9708 的 F1 分数,且两个类别的精确率和召回率对称。随后在跨越 2023 年至 2026 年的 3,500 多篇未见文章上的部署显示出一致的跨来源和时间稳定的分类模式,平均预测置信度超过 0.96,估计平均有 2.5% 的已检查新闻内容是由 LLM 改写或修订的。据我们所知,这是第一项超越记者自我报告感知,转向对土耳其新闻媒体中 AI 使用情况进行实证、数据驱动测量的研究。
引用
@article{arxiv.2602.13504,
title = {From Perceptions To Evidence: Detecting AI-Generated Content In Turkish News Media With A Fine-Tuned Bert Classifier},
author = {Ozancan Ozdemir},
journal= {arXiv preprint arXiv:2602.13504},
year = {2026}
}