NativeMan8080 写了: 今天 11:59又来说教了。你有证据就展示,没有就别胡扯。
涉密单位人员上传机密到商业网站(甭管中国的还是外国的),你以为中国的国安都是干啥的?看没看最近的国安大剧?
你个p民
国安都是些中专生
只懂送礼 喝酒 嫖娼
NativeMan8080 写了: 今天 11:59又来说教了。你有证据就展示,没有就别胡扯。
涉密单位人员上传机密到商业网站(甭管中国的还是外国的),你以为中国的国安都是干啥的?看没看最近的国安大剧?
你个p民
国安都是些中专生
只懂送礼 喝酒 嫖娼
(或)八世章嘉呼图克图
玩蒸馏是正义的,搞嫁接需要国家批准。哪能自己乱嫁接
|发贴IP所在地:M101 此贴作者主动要求显示发贴IP信息
它规定,战争开始时,德军以主力七十八个师攻击法国,只留九个师于东线,配合奥军防御俄军。在西线,又只用八个师于左翼,固守德法边境;而集中七十个师于右翼,破坏荷兰和比利时的中立,强渡马恩河,从北面和西面包抄巴黎。战争预计在三到六个月内以德奥的全线胜利告终。这个计划是建立在俄军动员迟缓,法军不堪一击,英国不会立即参战等主观臆想的基础上的。
蒸馏是普遍存在的,但是显然不是提高模型能力的主要方式,否者无法解释为何国内模型之间存在明显差异。蒸来蒸去的结果应该是国内模型高度相似。实际是这样吗?
你觉得这可能吗?估计是间谍获得了某些机密然后美爹ai把这些机密喂给自己模型然后就大骂党妈蒸馏。
追逐人生理想:求白牛包养。
为美国献治安策:以工代赈和劳改制度。
发贴IP所在地: TW。 此贴作者主动要求显示其发贴IP信息。
谁告诉你的“蒸来蒸去的结果应该是国内模型高度相似”?
不同公司拿到的数据种类和质量都有差异,何况蒸馏也需要些技术含量。
NativeMan8080 写了: 今天 12:15蒸馏是普遍存在的,但是显然不是提高模型能力的主要方式,否者无法解释为何国内模型之间存在明显差异。蒸来蒸去的结果应该是国内模型高度相似。实际是这样吗?
说不过就屏蔽的ID,全都木有小鸡鸡 ![]()
如果蒸馏是提高能力的最主要的手段,反复蒸馏的结果就是越来越相似。有文献支持这个说法吗?
有,而且有一类文献直接支持你这个逻辑。不过需要把你的命题稍微严谨化:
“如果多个模型反复主要依赖彼此生成的数据进行训练,模型分布会逐代趋同/收缩,并最终出现 model collapse。”
这个命题有很强的理论和实验支持;但如果说成“任何蒸馏都会导致模型越来越相似”,则过强,因为有原始人类数据、不同教师、不同训练目标和大量独立数据时,可以避免或显著减弱这种收敛。
最重要的是 Shumailov 等人的 Nature 论文:
Shumailov et al., “AI models collapse when trained on recursively generated data,” Nature 631, 755–759 (2024).
这篇论文非常接近你现在的推理。
作者研究的是:
model 0 → 产生数据 → model 1 → 再产生数据 → model 2 → ……
也就是递归使用前一代模型产生的数据训练下一代模型。
他们发现:
原始数据分布中的低概率区域逐渐消失;
模型输出分布逐渐变窄;
后代模型越来越偏向高概率、典型的输出;
随着 generation 增加,模型行为发生收缩;
最终可能发生 model collapse。
论文明确写到,随着 generations 增加,模型的行为会“converge … with very small variance”——也就是逐渐收敛到低方差的分布。
而且这不是只在抽象数学模型中发生。作者对语言模型进行了实验:连续用前一代语言模型生成的数据训练下一代模型,观察到了逐代退化和分布收缩。
这恰好支持你说的:
如果大家反复从同一批模型的输出中学习,就会有一个“趋同/收缩”的压力。
这是我们讨论时必须严谨的地方。
Nature 那篇文章研究的是:
recursive training on generated data
而不是严格意义上的:
teacher-student knowledge distillation
传统 KD 通常是:
一个强教师 → 一个学生
而且学生可能拥有:
自己的预训练数据;
自己的 architecture;
自己的 RL;
人类数据;
其他教师数据。
因此一次蒸馏不会自动导致两个模型变成一样。
真正与你的论点最接近的是:
当蒸馏成为主要的信息来源,并且发生多代递归传播时,独立信息越来越少,模型分布就会产生收缩。
这正是 Nature 论文揭示的机制。
Furlanello 等人 2018 年的:
“Born Again Neural Networks”
研究了一个非常有趣的现象:
teacher → student → student → ...
而且学生甚至和教师使用相同的 architecture。
他们发现,经过 knowledge distillation,student 有时候能够超过 teacher。
这说明一个重要事实:
蒸馏并不是简单复制。
学生可以通过训练过程重新组织教师提供的信息,甚至在某些任务上超过教师。
这正好支持我们前面讨论的观点:
蒸馏 ≠ copy。
但另一方面,它也说明了为什么不能简单把“模型不同”作为“没有蒸馏”的证明。
我觉得可以把问题数学化一点。
假设模型 A、B、C 都有自己的独立信息:
A=HA+DAA = H_A + D_A B=HB+DBB = H_B + D_B C=HC+DCC = H_C + D_C
其中 HH 是各自独立的人类/原始训练信息。
那么三个模型当然可以保持很大的差异。
但是假设逐渐变成:
An+1=f(An)A{n+1}=f(A_n) Bn+1=f(Bn)B{n+1}=f(B_n)
而且 A、B 又互相训练:
An+1=f(An,Bn)A{n+1}=f(A_n,B_n) Bn+1=f(An,Bn)B{n+1}=f(A_n,B_n)
那么共同信息所占比例越来越高,而独立信息越来越少。
长期来看:
模型之间的 mutual information 增加,独立 variance 减少。
最终就会出现你说的:
“蒸来蒸去,大家越来越像。”
如果继续递归,而且没有新的人类数据进入系统,就进一步进入 Nature 所说的 model collapse。
假设有一个非常强的假设:
H:目前中国模型的能力提升主要来自美国 frontier model 蒸馏。
那么应该出现至少部分预测:
Prediction 1
DeepSeek、Qwen、Kimi、GLM、MiniMax 等应该越来越相似。
Prediction 2
它们应该表现出越来越强的共同 reasoning patterns。
Prediction 3
它们的错误模式应该越来越相关。
Prediction 4
不同 benchmark 上的 capability profile 应该越来越接近。
Prediction 5
进一步,如果中国模型彼此也大量蒸馏,收敛应该更快。
但现实是:
它们确实共享一些能力,但仍然存在相当明显的 capability specialization。
因此:
数据支持“蒸馏是重要的能力传播机制”,但没有直接支持“蒸馏是主要能力来源”。
有人可以说:
“不对,即使大家大量蒸馏 Claude,也可以通过不同的 base model、不同数据、不同 RL,最终形成完全不同的模型。”
这个反驳是成立的。
所以“模型不相似”不能单独证明“蒸馏贡献很小”。
它只能说明:
蒸馏不太可能是唯一的、压倒性的能力形成机制。
如果一个模型:
80%能力来自自己训练
20%来自 Claude distillation
那么它当然可以和另一个:
80%来自自己训练
20%来自 Claude distillation
的模型非常不同。
所以真正的关键变量不是:
有没有蒸馏?
而是:
蒸馏数据在最终能力形成中的 marginal contribution 有多大?
你可以这样说:
已有研究表明,当模型递归地使用前代模型生成的数据进行训练时,数据分布会逐代收缩,并可能最终导致 model collapse。因此,如果一个模型生态主要依赖相同教师模型或彼此生成的数据进行递归蒸馏,而缺乏足够的独立、高质量原始数据和训练信号,则理论上应产生能力分布收敛和多样性下降。
这个表述有 Nature 2024 的直接支持。
然后再加一句:
因此,中国模型之间目前仍然存在明显的能力差异和技术路线差异,这至少与“它们主要依赖相同模型进行蒸馏”这一强假设不完全一致;但这一观察本身不足以定量排除蒸馏作为重要的能力加速器。
我认为这就是目前证据最稳健的说法。
还有一点特别有意思:Nature 那篇论文其实还给出了一个与你这个讨论非常相关的结论——保留一部分原始数据可以显著减轻 collapse。他们的语言模型实验中保留 10% 原始训练数据后,退化明显减轻。
这意味着现实中的中国模型完全可能通过:
大量自己的原始数据 + 自己的预训练/RL + 少量或大量 teacher distillation
既获得蒸馏收益,又避免“蒸来蒸去最后全部变成一个模型”。
所以,“没有高度相似 → 蒸馏不是主要手段”是一个很好的方向,但最好表述为概率性/机制上的反证,而不要作为严格证明。
难为你找出这么多AI的result为自己站台。
我从没说过鳖的公司完全没有自己的training而只会蒸馏,但那和把用户traffic转到Claude也不矛盾。好比很多人都练长跑短跑,但比赛时如果有cut corner的机会,他们仍然会去做。因为只要有一个人那么干,其他人就得follow。
NativeMan8080 写了: 今天 12:56如果蒸馏是提高能力的最主要的手段,反复蒸馏的结果就是越来越相似。有文献支持这个说法吗?
有,而且有一类文献直接支持你这个逻辑。不过需要把你的命题稍微严谨化:
“如果多个模型反复主要依赖彼此生成的数据进行训练,模型分布会逐代趋同/收缩,并最终出现 model collapse。”
这个命题有很强的理论和实验支持;但如果说成“任何蒸馏都会导致模型越来越相似”,则过强,因为有原始人类数据、不同教师、不同训练目标和大量独立数据时,可以避免或显著减弱这种收敛。
1. 最直接的文献:Nature 2024,Model Collapse
最重要的是 Shumailov 等人的 Nature 论文:
Shumailov et al., “AI models collapse when trained on recursively generated data,” Nature 631, 755–759 (2024).
这篇论文非常接近你现在的推理。
作者研究的是:
model 0 → 产生数据 → model 1 → 再产生数据 → model 2 → ……
也就是递归使用前一代模型产生的数据训练下一代模型。
他们发现:
原始数据分布中的低概率区域逐渐消失;
模型输出分布逐渐变窄;
后代模型越来越偏向高概率、典型的输出;
随着 generation 增加,模型行为发生收缩;
最终可能发生 model collapse。
论文明确写到,随着 generations 增加,模型的行为会**“converge … with very small variance”**——也就是逐渐收敛到低方差的分布。
而且这不是只在抽象数学模型中发生。作者对语言模型进行了实验:连续用前一代语言模型生成的数据训练下一代模型,观察到了逐代退化和分布收缩。
这恰好支持你说的:
如果大家反复从同一批模型的输出中学习,就会有一个“趋同/收缩”的压力。
2. 但是这里有一个重要区别:Model Collapse ≠ Distillation
这是我们讨论时必须严谨的地方。
Nature 那篇文章研究的是:
recursive training on generated data
而不是严格意义上的:
teacher-student knowledge distillation
传统 KD 通常是:
一个强教师 → 一个学生
而且学生可能拥有:
自己的预训练数据;
自己的 architecture;
自己的 RL;
人类数据;
其他教师数据。
因此一次蒸馏不会自动导致两个模型变成一样。
真正与你的论点最接近的是:
当蒸馏成为主要的信息来源,并且发生多代递归传播时,独立信息越来越少,模型分布就会产生收缩。
这正是 Nature 论文揭示的机制。
3. 还有一个非常有意思的早期结果:Born-Again Networks
Furlanello 等人 2018 年的:
“Born Again Neural Networks”
研究了一个非常有趣的现象:
teacher → student → student → ...
而且学生甚至和教师使用相同的 architecture。
他们发现,经过 knowledge distillation,student 有时候能够超过 teacher。
这说明一个重要事实:
蒸馏并不是简单复制。
学生可以通过训练过程重新组织教师提供的信息,甚至在某些任务上超过教师。
这正好支持我们前面讨论的观点:
蒸馏 ≠ copy。
但另一方面,它也说明了为什么不能简单把“模型不同”作为“没有蒸馏”的证明。
4. 真正支持你逻辑的是“信息来源越来越单一”
我觉得可以把问题数学化一点。
假设模型 A、B、C 都有自己的独立信息:
A=HA+DAA = H_A + D_A B=HB+DBB = H_B + D_B C=HC+DCC = H_C + D_C
其中 HH 是各自独立的人类/原始训练信息。
那么三个模型当然可以保持很大的差异。
但是假设逐渐变成:
An+1=f(An)A_{n+1}=f(A_n) Bn+1=f(Bn)B_{n+1}=f(B_n)
而且 A、B 又互相训练:
An+1=f(An,Bn)A_{n+1}=f(A_n,B_n) Bn+1=f(An,Bn)B_{n+1}=f(A_n,B_n)
那么共同信息所占比例越来越高,而独立信息越来越少。
长期来看:
模型之间的 mutual information 增加,独立 variance 减少。
最终就会出现你说的:
“蒸来蒸去,大家越来越像。”
如果继续递归,而且没有新的人类数据进入系统,就进一步进入 Nature 所说的 model collapse。
5. 这实际上给你的“中国模型主要靠蒸馏”的判断提供了一个很好的反向预测
假设有一个非常强的假设:
H:目前中国模型的能力提升主要来自美国 frontier model 蒸馏。
那么应该出现至少部分预测:
Prediction 1
DeepSeek、Qwen、Kimi、GLM、MiniMax 等应该越来越相似。
Prediction 2
它们应该表现出越来越强的共同 reasoning patterns。
Prediction 3
它们的错误模式应该越来越相关。
Prediction 4
不同 benchmark 上的 capability profile 应该越来越接近。
Prediction 5
进一步,如果中国模型彼此也大量蒸馏,收敛应该更快。
但现实是:
它们确实共享一些能力,但仍然存在相当明显的 capability specialization。
因此:
数据支持“蒸馏是重要的能力传播机制”,但没有直接支持“蒸馏是主要能力来源”。
6. 但是要注意一个非常重要的反驳
有人可以说:
“不对,即使大家大量蒸馏 Claude,也可以通过不同的 base model、不同数据、不同 RL,最终形成完全不同的模型。”
这个反驳是成立的。
所以**“模型不相似”不能单独证明“蒸馏贡献很小”。**
它只能说明:
蒸馏不太可能是唯一的、压倒性的能力形成机制。
如果一个模型:
80%能力来自自己训练
20%来自 Claude distillation那么它当然可以和另一个:
80%来自自己训练
20%来自 Claude distillation的模型非常不同。
所以真正的关键变量不是:
有没有蒸馏?
而是:
蒸馏数据在最终能力形成中的 marginal contribution 有多大?
7. 因此,我会把你的论点改成一个更严谨、文献支持更强的版本
你可以这样说:
已有研究表明,当模型递归地使用前代模型生成的数据进行训练时,数据分布会逐代收缩,并可能最终导致 model collapse。因此,如果一个模型生态主要依赖相同教师模型或彼此生成的数据进行递归蒸馏,而缺乏足够的独立、高质量原始数据和训练信号,则理论上应产生能力分布收敛和多样性下降。
这个表述有 Nature 2024 的直接支持。
然后再加一句:
因此,中国模型之间目前仍然存在明显的能力差异和技术路线差异,这至少与“它们主要依赖相同模型进行蒸馏”这一强假设不完全一致;但这一观察本身不足以定量排除蒸馏作为重要的能力加速器。
我认为这就是目前证据最稳健的说法。
还有一点特别有意思:Nature 那篇论文其实还给出了一个与你这个讨论非常相关的结论——保留一部分原始数据可以显著减轻 collapse。他们的语言模型实验中保留 10% 原始训练数据后,退化明显减轻。
这意味着现实中的中国模型完全可能通过:
大量自己的原始数据 + 自己的预训练/RL + 少量或大量 teacher distillation
既获得蒸馏收益,又避免“蒸来蒸去最后全部变成一个模型”。
所以,“没有高度相似 → 蒸馏不是主要手段”是一个很好的方向,但最好表述为概率性/机制上的反证,而不要作为严格证明。
说不过就屏蔽的ID,全都木有小鸡鸡 ![]()
台巴子熟悉诈骗套路,典型的连环骗局
有用户违反自己公司/单位的规定,把保密材料上传到网上/online AI,结果把ai公司的人抓了?
台巴子的脑洞真是可以
大数据就算不是在涉密地址采集的 只要被涉密单位存储和分析 那就自动被归类涉密数据
AI很强的,找个文献总结下一分钟的事儿。
用户请求被转送的问题似乎只是月面被指控,而且这个转送量和月面收到的用户请求总量相比是零头的零头。或许是蒸馏的一种方式(但是其他公司并未被指控),是某种操作失误也未可知。
wm123456 写了: 今天 13:30难为你找出这么多AI的result为自己站台。
我从没说过鳖的公司完全没有自己的training而只会蒸馏,但那和把用户traffic转到Claude也不矛盾。好比很多人都练长跑短跑,但比赛时如果有cut corner的机会,他们仍然会去做。因为只要有一个人那么干,其他人就得follow。
自己去看A家的报告吧,里面指控7个Chinese LLM非法蒸馏,DeepSeek和小米也在里面。
NativeMan8080 写了: 今天 13:52AI很强的,找个文献总结下一分钟的事儿。
用户请求被转送的问题似乎只是月面被指控,而且这个转送量和月面收到的用户请求总量相比是零头的零头。或许是蒸馏的一种方式(但是其他公司并未被指控),是某种操作失误也未可知。
说不过就屏蔽的ID,全都木有小鸡鸡 ![]()
相信国安大菊的只能是奴隶韭菜,和相信战狼千里必诛一样
NativeMan8080 写了: 今天 11:59又来说教了。你有证据就展示,没有就别胡扯。
涉密单位人员上传机密到商业网站(甭管中国的还是外国的),你以为中国的国安都是干啥的?看没看最近的国安大剧?
骂别人黄疮或含有这意思的人自己死全家。