我的学习群里全是真大佬 第475章

  李东想到了小黑,想到了田钢的项目,最后点了点头说道。

  “还是,挺重要的。”

  龚校长盯着他看了两秒,也点了点头。

  “行。”

  “这事儿我得琢磨琢磨,明天给你个准信儿。”

  “那就麻烦校长了。”

  李东点了点头,起身准备告辞。

  可他人还没走到门口,身后龚校长忽然又把他叫住了。

  “哎,李东教授。”

  李东回过头。

  “今年,多大了?”

  这话问得没头没脑,李东愣了一下,才老实答道。

  “二十一。”

  “今年四月二十四号,刚满的。”

  “谈女朋友了吗?”

  李东:???

  啥意思呀?出个国还要还要调查这些的吗?

  还是说……

  燕大现在,连这个……都包分配了吗?

第398章 好多老钱

  随着李东的身影离开办公室,龚校长这才叹了口气。

  二十一岁呀,菲尔兹奖得主。

  本事越大,外面盯着的眼睛就越多。

  这回是出去开会,那下回呢?

  还是要成家呀。

  成了家人就有了牵挂,心也就定下来了。

  可问题是……哪里去找学问上得聊得来,年纪相当,性子还得处得来呀。

  “哎。”

  他又叹了口气,这才拿起桌上的电话拨了出去。

  ……

  韩国,首尔。

  一辆黑色轿车,不紧不慢地朝着三成洞方向开去。

  李东坐在后排,有些发呆,他是真没想到,自己在首尔还有专车。

  老吴开着车,老张坐在副驾,从上车起就没有回过头,目光一直在观察着周围的情况。

  李东闲着没事用手指在车窗玻璃上敲了敲。

  笃,笃。

  声音发闷,一点都不像正常玻璃该有的脆响声。

  李东还想问问老张这到底是啥玻璃,然而看见老张正目视前方,透着一股生人勿进的气场,他也就打消了问的想法。

  此时车子拐过一个路口,一大片玻璃幕墙的建筑就出现在了眼前。

  COEX会展中心到了。

  这会儿会展中心门前的落客道上,已经排起了长队。

  清一色的高档轿车,缓缓往前蹭。

  会展中心的外墙上,挂几幅两层楼高的条幅。

  【ICML 2026】

  【第四十三届国际机器学习大会】

  李东隔着车窗看着外面的豪车,心里忍不住感叹了一句。

  这都特么是有钱人呀。

  不过也正常,谁叫这几年A是风口呢?这场大会来的可不只是学者,还有各家的VP以及风投。

  当前沿技术和资本凑到一处,门口的车能不值钱吗。

  车停稳以后,老张先一步下车,替李东拉开车门,随后跟在了李东的身后。

  前面不远处几辆商务车也刚刚停下,水木大学的队伍也下车了。

  李东朝着队伍走了过去。

  这一次水木带队的,是唐杰教授。

  他牵头做的那套千亿参数大模型底座早就过了B轮敲了钟,是各路资本的常客。

  这样的盛会,他自然不会错过。

  唐杰身后还跟着十来个水木的博士生、硕士生,一个个眼睛里都带着光。

  这次他们来这种顶会,主要是有的人论文过了稿,来交作业的。

  也有被选中做Oral到时候要上台扛住Peer Review的炮火汇报工作的。

  剩下的就是长见识的,然后在Poster Session(海报环节)看看能不能吸引来一些大佬指点几句。

  当然这场大会本身就是一个高级人才市场,大厂展台上拿高薪HC收简历,向来比网申痛快得多。

  所以这一队学生,从下车起就恨不马上进去。

  唐杰回头交代了学生们几句,转过身来,先看了一眼李东身后的老张,然后才朝着李东笑道。

  “李东教授。”

  “唐教授。”李东也笑着点头问好,然后才指了指那些豪车。

  “这个大会,规格很高啊。”

  “哈哈,因为有钱人多嘛。”

  他说完这句话,李东则是上下打量了下他那套价格不菲的西装

  唐杰先是一怔,随即哈哈大笑,摆着手往大门里走。

  “学校发的工资,学校发的工资。”

  ……

  进了会场,李东才算真正见识了什么叫顶会,ICM和这一比起来,确实显得有些小气了。

  将近一万人的注册规模,几层楼的会场早就被人群塞满了。

  而且海报厅都有记者在,因为有资本圈的大佬也在逛着这些展区。

  而企业展区,各家的展台一个赛一个的气派大屏幕上滚着SOTA(当前最佳性能)级别的Demo,穿文化衫的员工见人就递宣传册。

  李东跟着水木的队伍听了一上午的报告。

  不得不说,有几场是真让他开了眼界。

  头一场主旨报告,是GPT那边的一位研究负责人讲的他们这两年悄悄押下重注的一条新路。

  过去几年,圈子里卷的都是Pre-training(预训练)的规模。

  而他们换了打法,把算力杠杆翘到了Inference(推理)端。

  简单的说就是给模型引入System 2的慢思考机制,让它在吐出答案前先在隐空间里穷举推理树。

  这样一步一步生成思维链(CoT),走入死胡同就触发回溯机制,直到把逻辑闭环彻底打通再输出结果。

  而这种深层推理的泛化能力,根本没法靠人力标注去微调,完全是靠RL(强化学习)结合自博弈硬生生刷出来的。

  专门挑选数学证明和代码生成这类具备明确客观真值(Ground Truth)的任务,模型推导对了就给高维奖励信号,错了就切断反向传播。

  成千上万轮的PPO策略迭代下来,模型自己就涌现出了极为恐怖的试错与纠偏本能。

  台上直接甩出了一张Test-Time Compute(测试时算力)的对数曲线。

  同一套基座权重,只要允许模型在推理阶段多消耗十倍的Token进行内部演算,Hard级别任务的准确率直接顺着曲线呈现指数级爬升。

  报告还没讲完台下已经是一片低低的议论声。

  李东坐在水木的队伍中间,心里微微一动。

  数学,恰恰就是这世上提供最优验证奖励反馈的终极数据集。

  第二场的Oral是来自普林斯顿和卡内基梅隆的一支联合团队,讲的是一种颠覆性的非Transformer底层架构。

  他们拿状态空间模型做线性递归,时间复杂度从平方砍到线性,百万Token一口气吞下去,显存都不怎么涨。

  台下搞理论的当场就杠上了,两边谁也说服不了谁。

  至于最后一场Gemini那边一位研究员讲的是世界模型。

  他们不喂文本,直接喂视频,逼模型自己学会物理。

  练到最后,给模型一张图就能凭空生出一个三维世界。

  一上午听下来,李东心里大致也有了数

  国外这几家卡在Scaling Law最前沿的巨头,早就跳出了单纯堆积参数量和清洗语料的低效内卷区,一个个全在底层范式上变道。

  比的不再是谁的万卡集群规模更大,而是谁先在架构和推理机制上完成破局。

  这些学术直觉,确实敏锐到了极点。

  反观国内,多数厂家还在旧的红海路线里跟进。

  猛灌通用指令微调,卷参数规模,刷榜单的分数,卷B端落地商业化。

  报告也多半集中在分布式训练的通信优化或者显存切分等工程Trick上。

  不过……

  当然也是不是全,也有一些国内团队搞出了一些不一样的东西。

  有两篇做长序列高效KV Cache稀疏化的,还有一篇用大模型反向生成高质量合成数据做自我蒸馏的,思路一样惊艳,台下举手要论文源码的人一样很多。

  更有意思的是开源基座这条路。

  国外顶尖名校的博士生们如今跑消融实验,底层模型十有八九加载的都是华夏的开源权重,调用便宜,对齐做得好,魔改接口还很开放。

  这一条生态护城河上,反倒是国内走在了前列。

  ……

第399章 李东来了

  中午休息的时候,主会场外的大厅里。

  人群三三两两的凑在一起,也不知道在讨论些什么,时不时的还会爆发出一阵的老钱笑声。

  李东和唐杰站在大厅一角。

  “怎么样,听出门道没有?”

  唐杰端着一杯咖啡问道。

  李东:“底层范式全在切变道。”

  “眼光够毒的呀。”

  唐杰有些诧异的说道。