帖子作者结合自己用大语言模型辅助审稿、以及收到疑似高度依赖模型生成文本的评审经历,归纳出三类反复出现的问题:首先,模型很擅长罗列未被显式控制的变量,能围绕任何实验生成近乎无限的潜在混杂因素,例如在肥料A与肥料B影响树木生长的研究中追问降雨、草地分布、风、温度、土壤微生物等是否完全隔离;这些问题单独看似乎合乎逻辑,核心却在于它们是否足够重要、足够可能动摇论文结论,而模型往往不会做这种优先级判断,容易把轻微残余不确定性包装成严重方法缺陷。其次,与有经验审稿人通常应针对具体论文、目标、架构或学习关系提出可反驳意见不同,模型生成的评审常停留在研究领域层面,比如笼统声称某方法与“Transformer中的方法”差异不足,却不指出哪篇先前工作、哪些组件或机制真正重合,导致作者难以作出有针对性的回应。第三,模型还会因高层术语…
来源:Reddit(r/MachineLearning)
原始发布时间:2026年8月4日 17:03