「OpenAI工程师说大厂几乎不看论文,因为大部分都是造假」——这句话这两天顶上了知乎热榜,问题底下的追问也扎心:你有没有踩过论文复现不了的坑?有没有见过用测试集标签选参数,等于偷看答案再答题的操作?## 一句话是怎么冒出来的
热榜上的问题措辞很直接:现在大多数大型实验室的人几乎不看论文,理由是大部分论文都是造假的。这句话被单独摘出来当成问题标题,后面跟着两个具体场景的追问——论文跑不出论文里写的结果,以及拿测试集的标签去反推参数,再拿这组参数去刷分。
后面那种做法,知乎问题里给了个挺形象的说法:等于先偷看答案,再假装自己做对了题。放到审稿和复现的语境里,意思是数字好看,方法未必站得住。
牵涉到的人
这句话的出处,据网传是一位自称在OpenAI工作的工程师,但知乎问题本身没有给出具名信息,也没有链接可以核实身份、职位、发言场合。换句话说,「OpenAI工程师」目前只是一个标签,不是一个可以对上号的人。
另一头是知乎评论区里的从业者。有人翻出自己复现失败的经历,有人聊起同行用测试集标签调参数这种打擦边球的做法。这些回答构成了热榜讨论的主体,但同样是个人陈述,没有公开的论文编号或机构名字可查。
事情怎么走到今天
论文数量这些年涨得快,顶会投稿量一年比一年多,审稿人时间有限,复现率一直是圈内老话题,只是平时没多少人愿意公开说。这次是因为把「造假」两个字直接摆上台面,才从一个技术圈内的抱怨,变成了热榜话题。
类似的AI大厂内部争议,这两年不是第一次冒头。之前张一鸣叫停AI蒸馏那阵子,也是一句内部说法被搬到台面上,才引出后面一连串讨论。这次的区别是,连说话人是谁都还没搞清楚。
几个说不通的地方
第一,「几乎不看论文」和「大部分都是造假」,这两个判断分量都不轻,但问题原文没给任何数字或案例支撑,听起来更像个人观感的放大。
第二,论文跑不出结果和论文造假,是两件不一样的事。前者可能是复现条件没写全、代码没开源、环境不一致;后者是刻意作假。两者混在一句话里说,容易把普通的复现难,说成蓄意造假。
第三,用测试集标签选参数,算不算造假,业内没有统一说法。有人认为这是方法论上的硬伤,也有人觉得只是没把训练集和测试集分干净的失误。程度不一样,性质也不一样。
第四,说这话的人身份还没坐实。类似的身份核实,之前梁文峰早期微博被扒的那次也是先有一句话,后面才慢慢有人去对信息源。这次热榜问题目前还停在「据说」的阶段。
最值得继续盯的疑点
这句话能不能对上具体的人、具体的实验室、具体的论文,是接下来最该盯的地方。学术圈类似的信源核实,南大数院辞职信来源起底那次也是拖了一阵子才有更清楚的说法。这次要是有人能把「OpenAI工程师」这个标签坐实,或者反过来证伪,热度大概率还会再涨一轮。
读者最关心的几件事
这位「OpenAI工程师」具体是谁?
知乎问题里没有具名信息,目前只是一个未经核实的说法。
「用测试集标签选参数」到底是什么意思?
简单说就是拿测试集里本该保密的答案,反过来去调整模型参数,再用这组参数去跑测试集打分,分数自然好看,但不代表模型真的学到了东西。
论文复现失败和论文造假是一回事吗?
不是。复现失败可能是条件没写清楚、代码没公开、环境差异等技术原因;造假是明知故犯地伪造结果,两者性质不同,不该混着说。
这个说法有没有被OpenAI或者其他大厂回应?
截至目前,没有看到相关方的正面回应。
