我的学习群里全是真大佬 第512章

  所以李东没明白意思。

  克拉拉好像猜到了他在想什么,她说:“不是合作关系。”

  她很认真地说了一个中文词“同——伙。”

  “这叫同伴。”

  “哦哦,同伴同伴。”

  李东都快被她气笑了,不过也由于这番打闹,他心里的沉闷也淡了一份。

  就在这个时候,克拉拉继续说道。

  “不过你可要跟上我,跟不上我的步伐的话,这个同伴关系可能持续不了多久。”

  李东:???

  这玩意儿是上天派来惩罚他的吗?

  怎么老抢他台词呀!

  李东刚想怼回去说“那你也小心我给天桶个窟窿哟”,然后突然就想到,对面的人也不是个善茬,于是又把话咽了回去。

  “好吧,那把数据发来吧。”

  “对了,先说好这次可没钱!”

  “李东——!”

  嘟嘟嘟……

  挂了电话没多久,李东就收到了克拉拉的邮件。

  邮件的正文里就写着三个字,看附件。

  下面就是六个附件。

  运行日志、探测器标定记录、本底扣除的原始参数、三十年每一次氩-37提取的回收率验算单、四氯乙烯批次的纯度检验档案,还有几个探测站之间同期交叉比对的完整序列。

  李东把六个附件挨个点开。

  最后那一项交叉比对的序列,他有些吃惊的看了好几次,确定没看错。

  这东西理论上属于布鲁克海文国家实验室的内部存档,三十年来从来没有完整公开过。

  能拿到这套完整序列的,不可能是一般渠道。

  “牛逼!”

  ……

  接下来将近一周,李东就都在排查他之前的三个思路。

  他先排查的是探测系统偏差这一块。

  他把三十年的回收率验算单全部打开,然后依次对比。

  霍姆斯特克实验每隔几周就要把液体里生成的氩-37抽出来,每一批的抽取效率都不一样,有几批数字偏低,也有几批数字偏高。

  如果只看平均回收率,大概在95%左右,属于合理范围。

  接着他又把标定记录调了出来。

  里面记录了探测器在三十年运行期间做过几次重大维护,每次维护前后的本底测量值都有详细记录,李东仔细的对比了下误差,发现没有明显的跳变。

  至于四氯乙烯的纯度档案,他看得最仔细。

  因为如果液体里混进了对探测有干扰的杂质,那理论上应该在不同批次之间看到系统性的流量波动,而不是始终趴在同一个三分之一附近。

  他把纯度数据和流量曲线叠在一起看,纯度高的批次和纯度低的批次,流量没有明显区别,波动范围都在同一个区间里。

  探测器和液体都没有问题,所以那条曲线并不是测量误差。

第440章 小心资本

  在确定不是探测器的问题以后,李东又盯上了太阳模型。

  太阳核心的温度估算,依赖于光度、化学组成和辐射不透明度这一串输入参数,每一个都经过了几代物理学家的反复校准。

  如果其中有哪个参数有问题,那理论预测的流量就会跟着出问题,所以就算真的是哪个参数有问题,它真的能刚好凑出三分之二来吗?

  李东二话不说,直接开始试。

  他把巴考尔最后一版标准太阳模型的误差分析翻出来,往里代了几组参数,又把核心温度上下各调了1%,算出来的流量预测值偏移量在8%以内,完全对不上三分之二这个缺口。

  即便把所有不确定性全部叠加在一起,模型误差的上限也不够大。

  所以太阳模型也没有问题。

  那这条曲线反映的不是仪器的偏差,也不是理论的错误的话。

  那就这剩下一个问题了,中微子在途中出了问题……

  不过李东抱着严谨的态度,又开始重新检查。

  ……

  大概一周以后,李东深深叹了口气。

  他已经完全排除了这两个方向。

  剩下的只有最后一条路了……

  就在这时候,他的手机响了。

  电话是威滕打来的。

  “李东教授,我明天就要回普林斯顿了。”

  “杨先生和我一起研究的那道命题,你如果有兴趣,我随时欢迎。”

  “威滕教授,我发现了一些东西,但现在还不确定。”

  “等有了一些进展以后,我再和你沟通。”

  电话那头威腾教授轻咦了一声。

  “你也发现了有趣的东西?我也发现了一些有趣的东西,看来到时候咱们真的好好交流下。”

  “好的,威滕教授。”

  李东和威滕聊完以后,就挂了电话。

  可正当他准备好好看看,中微子到底在路途中出了什么问题的时候,电话又响了。

  这一次是高稳打来的。

  “李东啊,今晚有场晚宴,燕大牵头的,主要是关于未央往通用大模型走的一些事情。”

  “通用大模型?”

  要知道,市面上的通用大模型,底层靠的是概率拟合,输出什么取决于最可能的下一个词。

  而未央不一样,它的每一步推理都必须过形式化核验器的类型检查,靠的是可验证的奖励信号来修正自己。

  换句话说,它是被机器判对练出来的,而不是被人类偏好喂出来的。

  如果这套底层逻辑往通用场景迁移,意味着它给出的推理链,是可以被逐步追溯和核验的,这在通用大模型里,几乎是不存在的东西。

  高稳那边时不时还能听到喇叭声,像是在开车。

  “对,因为我们知道它的优势,所以想往通用大模型靠拢。”

  “所以这次圈子里一些厂商的人会来,学校的意思是想听一听他们那边的想法,想让你也一起过来把把关。”

  “未央没挂你的名字,但这块核心是你的。”

  “学校也希望听听你的意见,到时候如果觉得合适,我们商量一下和这边有没有合作的空间。”

  “毕竟通用大模型这个东西,想要做得长久,是真的非常烧钱的。”

  这话没有半点夸张。

  通用大模型的训练成本从来不是小数字。

  即便只是中等规模的一次全量训练,光是算力租用这一项,就不是普通高校科研经费能够轻松覆盖的。

  燕大自己做,算力成本、数据成本、工程人力成本加在一起,压力其实很大。

  所以学校想和外面的厂商聊聊,这件事本身没什么问题。

  李东看了看时间,已经下午了。

  他又看了看桌上的那条中微子数据曲线,第三条路还没开始走,回来再看也一样。

  “行,我去。”

  ……

  晚上七点半,老张把黑色轿车停在了澜湾酒店的门口。

  李东下车的时候发现外面已经站了不少人。

  除了北行的李总他认识以外,旁边站的人他大多不认识,只不过他也在一些科技板块上见过。

  见李东下了车,这些人笑着迎过来,挨个和握手。

  “李东教授啊!真是年轻有为呀。”

  “久仰久仰,李东教授如果有空可以来我们公司参观参观……”

  他们大多都说着恭维的话,李东现在的身份已经不是一个学生了,他是燕大和水木两所顶尖院校的讲席教授,这些人虽然可能求不到他,但是场面话又不花钱,多说总是没错的。

  李东也一一点头后就跟着众人进了酒店大厅。

  大厅里已经有不少燕大和水木的教授。

  唐杰教授在人群里看见了李东,走过来将他叫到了一个没人的角落。

  “李东教授呀,未央通用大模型的测试版你试过啦吗?”

  李东别说试过了,他连未央出了通用大模型测试版也是今天才知道的。

  “我还没有,唐教授试过了?”

  “嗯试过了,能力很出色,这不用多说。”

  他顿了一下,然后说:“但如果是要往通用方向走,有几个地方,现在看来还不够。”

  李东说:“说说看?”

  “我先说好的地方。”唐杰说道。

  “凡是有标准答案、靠硬推理的榜单,它都强得离谱,简直可以说是断层领先。”

  “而且,我很意外他在SWE-bench上的表现也是出人预料的好,几乎也是断层的水平。”

  SWE-bench测试的不是大模型单独写代码的能力,而是把模型直接扔进一个真实的开源项目里,让它读懂整个代码库,再去修一个真实存在的bug。

  这玩意儿吃的是长链条的推理能力,一步错,后面全错。

  通用模型在这张榜上普遍吃力。

  未央能在上面取得好成绩,其实并不意外,未央的底子就是一步一步可核验的推理,它天生不爱跳步,也不爱瞎编,这习惯挪到代码上,反而成了优势。

  “但是,”唐杰话锋一转,“另外那些榜,就不太好看了。”

  “最明显的是Chatbot Arena。”

  这张榜在大模型圈子里份量很重,它考的不是谁算得准,是真实用户更愿意跟哪个模型聊。

  因此并没有标准答案,打分的不是机器,是一个一个的活人,凭感觉投票。

  全球的大厂为了在这张榜上有好名次,会专门做一道叫RLHF的工序,反复拿真人的偏好去打磨模型,让它学会怎么把话说得让人舒服。

  未央在这张榜上的名次,低得几乎可以忽略。

  “它太死板了。”

  “你给它一道题,它的推理无懈可击,可你换个方式问同一件事,它就不一定能灵活地调整切入角度。”

  “它的训练信号从来不是人类喜不喜欢,是核验器判它对不对,所以它压根没学过怎么揣摩人话。”

  李东在心里想。

  “唐杰教授,你说的没错,但那时因为我没时间去优化这些,额……小黑没时间,算了,反正我没时间就是小黑没时间!”