我的学习群里全是真大佬 第482章

  里面有之前小黑没吃完的相关知识,以及他最近在别人脑子里薅来的灵感。

  李东把U盘插进笔记本,将里面的东西全部扔给了小黑。

  “开饭。”

  “谢谢主人!”

  小黑欢呼一声,整个身子立刻一缩一胀地动了起来。

  机柜那边散热风扇的声音猛的变大,显存负载曲线再次飙上了一个新台阶。

  李东也不催它。

  反正回去也睡不着,他干脆靠在主控台前的工学椅上,慢悠悠地看着这一屋子指示灯烁成的矩阵。

  他很想知道,小黑弄出来的那个更优秀的大模型,在底层逻辑上到底会是个什么样子。

  这一等,就是一个来小时。

  等他再去看小黑头顶那根进度条的时候,整个人都愣住了。

  【10%】。

  李东揉了揉眼睛。

  之前还是25%现在变10%了?

  这到底是什么计算逻辑?

  李东盯着那个数字看了半天……

  “难道说是之前喂给小黑的那些知识里,有很多知识缺了核心的前置公理,所以小黑并没有理解?”

  “而今晚这一U盘的理论,恰好把这些知识点给打通了?”

  “所以小黑就消化了?”

  李东顺着这个思路往下想,这个进度条恐怕不是代表小黑掌握了多少知识,而是还剩下多少知识没吃透?

  就在这时,小黑说话了。

  “主人,我已经吃完啦。”

  李东摇了摇头将刚才的胡思乱想甩了出去。

  “那你现在,给我做一个你在架构上觉得足够SOTA的玩具出来呀。”

  小黑:???

  李东:???

  你给我一串问号是什么意思?

  过了两秒,小黑头顶才出现一行字

  “主人,我编译不出来呀。”

  “得主人定义好优化的目标函数,小黑才知道往哪个方向收敛呀。”

  “只要有了目标,小黑就能把外面那些低端玩具的系统架构Bug,全都绕开。”

  李东随即恍然。

  对啊。

  小黑消化掉的,是纯粹的理论公理。

  这世上关于底层算子怎么写的逻辑,它如今跑得恐怕比这颗星球上任何编译器都牛逼。

  可“做什么功能”,它没有输入参数。

  它没见过李东心里构想的那个架构长什么样。

  真让它放开权限盲审,它多半会调取克劳德、GPT、Gemini那几个现成的Checkpoint当底座去微调,再把那些灾难性遗忘的低级Bug挨个修补掉。

  可那样拼凑出来的缝合怪,说到底也只是个打了补丁的强化版。

  底层范式没换,前端套得再花哨,骨子里还是那套Auto-Regressive的废柴逻辑。

  所以李东得给它写死一套绝对严格的Prompt规则,明确新架构的输入输出和边界条件。

  而且逻辑链必须强一致,半点不能让小黑的优化器跑到伪命题里去。

  这就意味着,他自己得先把这个从0到1的底层拓扑彻底想透。

  至少,在逻辑上做到完美闭环。

  底层的工程实现可以全抛给小黑,可定义“产品级定义”这件事,谁也替不了他这个架构师。

  李东:……

  他看着屏幕角落的小黑,没忍住在心里嘀咕了一句。

  合着你和外面那些只会玩文生图的妖艳贱货,也没什么本质区别啊?

第405章 克劳德·埃尔伍德·香农

  不过李东刚冒出这个想法,他自己就先否定了。

  外面那些大模型,你告诉它做什么,它还给你的,是它训练语料里见过的所有“怎么做”的统计平均值。

  哪怕算力是无穷的,他都跑不出训练语料框定的分布边界。

  输出层那张低秩的表,注定了有些答案它从根上就表达不出来。

  这些先天性的基因缺陷,不是调参就能调好的。

  这是自回归范式本身的绝症。

  你让它规避缺点,它会还给你一篇像模像样的综述,然后在第一个没有先例的地方,体面的继续编下去。

  而小黑呢?

  小黑吃的东西是底层逻辑,不是文本Token。

  它能从代数群的角度把加和乘统一定义,把分布式集群里跨节点的异构数据归一化到同一个等变流形上,把所有冗余统统扔掉,只留最底下那层道理。

  信息论里有个老说法,谁能把一堆数据压缩到极限,谁就等于摸到了这堆数据背后的规律。

  压缩的尽头,是理解。

  外面那些模型,是在拟合知识的影子。

  而小黑是在重写知识本身。

  所以给它一张图纸它能把图纸上每一根线都钉到实处,还能顺手把图纸里画歪的地方修平。

  可这世上还不存在的那张图纸,它不会无中生有。

  外面的模型画不出没见过的图纸,小黑同样不会。

  而李东,恰好是这颗星球上少数几个,能把还不存在的东西,在逻辑上提前想清楚的人。

  因为他有思维沙盘!

  一个能想明白要什么的人。

  加上一个能把怎么做做到头的小黑。

  这两个鬼东西凑到一块儿,才是外面那些大厂砸几万张H100、养几千号算法工程师,也卷不出来的降维打击。

  想通了这一层,李东把椅子往主控台前拖了拖,坐直了。

  “小黑,听好了。”

  “我要的,不是一个会聊天的玩具。”

  “我要一个不会撒谎的数学家。”

  说完这几句话以后,李东停了下来。

  他闭上眼睛一个没有边界的沙盘在他的脑中出现。

  【思维沙盘】0.6逻辑的衍生技能。

  李东从记忆宫殿那座临时书架上,把首尔带回来的那些灵感尽数扔进了沙盘。

  这些只有一部分的灵感以及思路在落进沙盘的一瞬间,一条条思路被自动剥开李东所有吃透的知识自动开始在他的脑中匹配这些思路。

  第一条,把参数往天上堆,把数据往海里灌……

  然后塌了。

  第二条,让模型自己出题,自己生成数据,再反过来喂自己这条路在遇见“不许撒谎”这件事上……

  也塌了。

  而第三条。

  慢思考,可验证的奖励,自己跟自己博弈。

  这条思路一路往前铺,铺过一个又一个岔口,直到铺到沙盘的视野尽头,都没有塌。

  因为它每往前一步,脚下踩着的,都是“被机器判对”这四个字。

  奖励对了路就不会歪。

  所以这条路通了。

  还有几条,走到半路,沙面上的骨架忽然糊成了一团。

  那是李东还没真正吃透的地方。

  沙盘不会凭空生出他不曾拥有的知识,它只负责把他已经握住的知识用到尽头。

  说起来要不是姚先生那一堂课和这阵子他硬啃了那么多的知识,今晚这片沙盘他压根就铺不开。

  几分钟后,李东睁开了眼睛。

  接下来,他把沙盘里活下来的那些思路连同自己心目中的那个AI for Math,一点一点的讲给小黑听。

  模型的每一步推理,都必须翻译成最严格的形式化语言,送进Lean那样的证明器里,一行一行过类型检查。

  对就是对,错就是错。

  想不出来,就老老实实说想不出来,不许瞎编。

  ……(略)

  这世上成千上万的行业,也只有数学这门学科,给得起这种非黑即白的答案。

  模型的最终的设计交付,绝对不能是一个给教授代写水稿的LLM工具。

  它该是一个能与你并肩往无人区里推进的同事。

  最后,李东把那几条在沙盘里塌掉的死路,也告诉了小黑。

  李东说得很慢,也很细。

  像在给一个聪明绝顶却没见过世面的孩子,描述外面的世界。

  等他说完这些,嗓子都有些发干了。

  小黑安安静静听完,蹦了一下。

  “明白啦,主人!”

  “小黑想一想哦。”

  说完,它又开始一缩一胀的了。

  ……

  李东起身活动了下腿脚,刚想去翻包里的水。

  手机突然又震了一下。

  这一回他注意到了。

  锁屏上照旧空空荡荡,没有任何推送。

  老规矩,青龙学习小组。

  他点开群,【入群申请】那一栏,挂着一个红点。

  点进去,还是那个待在那已经快一年的入群申请。