heteroclinic 写了: 昨天 12:55热力学传热学已经研究相变很多年了,锅炉是最典型的,这种NS没有用,但有经验公式。
chatgpt说clay 的问题是,存在“初始流场非常漂亮,NS 自己会不会在有限时间 \(T\) 把某个量搞到无穷大”
https://chatgpt.com/share/6aa18ea2-e2d0 ... 993cb6723fPROMPT
那10万agent 做的是lean code ,找到了一个blow up。这个理解是否正确? 如果再做一遍,是否有相同结果,如同重力波,中国人巴西人日本科学家能否重复?chatgpt
"所以我很赞成你用“中国人、巴西人、日本人能不能重复”这个标准。如果只是 OpenAI 自己跑一次 agent swarm → 自己产生 Lean → 自己宣布 Lean 验证成功,这叫很强的内部验证,还不能等同于科学意义上的独立 replication。而且还有一个比“重新跑 agent”更狠的测试:不给第二组 proof,只给最终构造 \(u(x,t)\) 的定义,让他们独立证明它确实满足 NS、满足 Clay 的全部 admissibility 条件,并且有限时间 blow-up。 如果不同国家的 PDE 专家能独立完成这一点,我会认为其可信度比“再烧 1300 亿 tokens 得到一次相同输出”高得多。"
“Hype-vaccinated” 其实是个挺准确的词:不是 anti-AI,而是要求 denominator。只告诉我成功了一次,不告诉我试验空间、失败次数和可重复率,我很难从中推断能力有多大。
如果同一个高难问题在完全独立、清空上下文的条件下重复跑 100 次,只要有 1 次再次得到一个可独立验证的有效 proof,我也会认为这已经说明系统不是纯偶然幻觉。因为这里要求的不是“输出看起来像证明”,而是第二次结果也必须经过形式验证和专家检查。
Garbage in
Garbage out.
