新智元报道
三分之一的arXiv论文,竟然是AI写的?
最近,unslop发布的一份研究报告在网络上引发了剧烈震荡。
数据显示,过去一年内,计算机科学领域有65%的新论文被其检测器标记为疑似AI生成。
这一结果让网友戏称,我们正身处「大泔水时代」。
但讽刺的是,同期数学论文的标记率仅为0.7%。
ChatGPT一经问世,数据曲线便呈垂直拉升之势。
在这项研究中,研究团队梳理了12750篇arXiv论文,时间跨度从2023年1月延伸至2026年7月。
研究选取了十个学科作为样本,每个领域每月随机抽取约25篇全文进行分析。
为了建立基准线,对照组选定了2021至2022年,那是ChatGPT尚未普及的纯人工写作时期。
数据表明,在2021至2022年间,标记率一直稳定在0.4%的低位;但随着ChatGPT的发布,该数值在数月内迅速攀升。
在最近一个完整的统计季度里,整体标记率达到了32%,而在2026年初,峰值更是逼近39%。
具体到各个学科,计算机科学的状况最为严峻,标记率高达65%。
值得注意的是,在ChatGPT出现之前,这一领域的基线数值仅为0.2%。短短三年间,数字暴涨了300多倍。
紧随其后的是定量生物学(56.3%)、电气工程(51.3%)以及经济金融(47%);随后的应用物理占比34%,统计学31.3%,凝聚态物理24%,高能物理14%,天体物理10.7%。
榜单末尾是数学:0.7%。
同一套检测系统,面对同一个论文库,两者落差接近100倍。
这不禁让人疑惑:是数学家们集体坚持手工撰写,还是这台机器在面对数学公式时彻底失效?
跌入谷底的0.7%,揭示了机器的盲区
事实上,unslop在报告中已经给出了部分解释。
回顾一篇标准的数学论文,其中充斥着符号、公式、定理与证明过程,真正由英语构成的叙述性段落寥寥无几。
而当前的检测器主要依赖文本特征进行判断,它关注的是句子结构、用词偏好及段落逻辑。
数学论文中仅存的少量文字,多为「设X为……」或「由引理3推导」等高度格式化的表达,这与检测器训练数据中的科学英语风格截然不同。
因此,团队坦言目前的研究存在局限:
数学领域的0.7%尚不足以定论。这可能是数学家确实少用AI,也可能是检测器无法识别数学内容,但现有数据无法区分这两种情况。
此外,对照组样本量偏小。每个学科仅包含200篇ChatGPT前的论文,按0.4%的误报率计算,2000篇中仅有8篇被标记。这种规模只能提供粗略估算。
加之前文所述的检测不全问题,上述数据仅是下限,真实比例可能更高。
越内卷的领域,对AI的依赖越深
究竟是谁在利用AI撰写论文?
答案隐藏斯坦福另一项历时两年的调研中。
2024年3月,斯坦福Weixin Liang团队率先将目光投向同行评审环节:在ICLR 2024的审稿意见中,约10.6%的句子曾经过大型语言模型的大幅修改。论文尚未定稿,审稿人便已介入使用。
2025年8月,该团队将样本扩大至112万篇论文,研究成果直接发表于《自然·人类行为》期刊。
研究显示,截至2024年9月,计算机科学论文摘要中经LLM修改的比例最高已达22.5%。且使用频率最高的群体,正是那些频繁发布预印本、处于学术竞争最前沿的研究者。
领域越内卷,使用力度越大。
在此情境下,AI写作已演变为一种军备竞赛:当同行借助AI提升效率时,仅依靠手写的人必然落后一步。
难怪这份报告在X平台流传甚广的一条转发,配文开篇便是:「提示词:写一篇能发arXiv的论文。」
它嗅出的是「味道」,而非事实
不过,暂勿急于依据这65%的数据定罪。
团队在报告中明确指出,检测器无法区分「AI辅助润色语法」与「整篇机器代工」,它仅能识别文本中的机器化特征浓度。
因此,65%更准确的解读是「65%的论文带有AI气味」,而非「65%的论文由AI撰写」。
麻烦在于,这种机器味并非AI独有。
曾有研究者不信邪,将自己多年前的旧作投入检测工具,结果27%至74%的内容被标红。
要知道,在那个年代,ChatGPT甚至还未诞生。
原因显而易见。
纵观当下的学术期刊,满篇皆是大型语言模型、基准测试等行业热词。措辞越规范,结构越严谨,越容易触发检测器的警报。
况且,LLM本身就是基于此类论文训练而成。并非学者写得像AI,而是AI生来就模仿学者的笔触。
当所有文字都成为嫌疑对象
其实这两年,我们都在做着与检测器相似的事情。
读到一段四平八稳、词句工整、惯用「不仅……而且……」结构的文字时,心中难免咯噔一下:这莫非是AI生成的?
unslop的检测器,不过是把这种模糊的直觉转化为可量化的数字工具。
一旦怀疑植入脑海,便难以移除。
过去,「书写」本身就是一种背书。作者愿意花费数小时组织文字,至少证明其态度认真。
如今,无论文笔多么优美,都可能只换来一句「这是AI写的吧」。
甚至有人开始刻意避开自己半辈子使用的词汇,只因它们「听起来太像AI」。
此刻,「AI味」正演变成席卷文字圈的新型原罪。
颇具讽刺意味的是,直到今天,我们仍未能精确测量这股原罪的具体构成。
参考资料:
https://unslop.run/blog/measuring-ai-writing-on-arxiv
编辑:摩西
秒追ASI












