所以李东没明白意思。
克拉拉好像猜到了他在想什么,她说:“不是合作关系。”
她很认真地说了一个中文词“同——伙。”
“这叫同伴。”
“哦哦,同伴同伴。”
李东都快被她气笑了,不过也由于这番打闹,他心里的沉闷也淡了一份。
就在这个时候,克拉拉继续说道。
“不过你可要跟上我,跟不上我的步伐的话,这个同伴关系可能持续不了多久。”
李东:???
这玩意儿是上天派来惩罚他的吗?
怎么老抢他台词呀!
李东刚想怼回去说“那你也小心我给天桶个窟窿哟”,然后突然就想到,对面的人也不是个善茬,于是又把话咽了回去。
“好吧,那把数据发来吧。”
“对了,先说好这次可没钱!”
“李东——!”
嘟嘟嘟……
挂了电话没多久,李东就收到了克拉拉的邮件。
邮件的正文里就写着三个字,看附件。
下面就是六个附件。
运行日志、探测器标定记录、本底扣除的原始参数、三十年每一次氩-37提取的回收率验算单、四氯乙烯批次的纯度检验档案,还有几个探测站之间同期交叉比对的完整序列。
李东把六个附件挨个点开。
最后那一项交叉比对的序列,他有些吃惊的看了好几次,确定没看错。
这东西理论上属于布鲁克海文国家实验室的内部存档,三十年来从来没有完整公开过。
能拿到这套完整序列的,不可能是一般渠道。
“牛逼!”
……
接下来将近一周,李东就都在排查他之前的三个思路。
他先排查的是探测系统偏差这一块。
他把三十年的回收率验算单全部打开,然后依次对比。
霍姆斯特克实验每隔几周就要把液体里生成的氩-37抽出来,每一批的抽取效率都不一样,有几批数字偏低,也有几批数字偏高。
如果只看平均回收率,大概在95%左右,属于合理范围。
接着他又把标定记录调了出来。
里面记录了探测器在三十年运行期间做过几次重大维护,每次维护前后的本底测量值都有详细记录,李东仔细的对比了下误差,发现没有明显的跳变。
至于四氯乙烯的纯度档案,他看得最仔细。
因为如果液体里混进了对探测有干扰的杂质,那理论上应该在不同批次之间看到系统性的流量波动,而不是始终趴在同一个三分之一附近。
他把纯度数据和流量曲线叠在一起看,纯度高的批次和纯度低的批次,流量没有明显区别,波动范围都在同一个区间里。
探测器和液体都没有问题,所以那条曲线并不是测量误差。
第440章 小心资本
在确定不是探测器的问题以后,李东又盯上了太阳模型。
太阳核心的温度估算,依赖于光度、化学组成和辐射不透明度这一串输入参数,每一个都经过了几代物理学家的反复校准。
如果其中有哪个参数有问题,那理论预测的流量就会跟着出问题,所以就算真的是哪个参数有问题,它真的能刚好凑出三分之二来吗?
李东二话不说,直接开始试。
他把巴考尔最后一版标准太阳模型的误差分析翻出来,往里代了几组参数,又把核心温度上下各调了1%,算出来的流量预测值偏移量在8%以内,完全对不上三分之二这个缺口。
即便把所有不确定性全部叠加在一起,模型误差的上限也不够大。
所以太阳模型也没有问题。
那这条曲线反映的不是仪器的偏差,也不是理论的错误的话。
那就这剩下一个问题了,中微子在途中出了问题……
不过李东抱着严谨的态度,又开始重新检查。
……
大概一周以后,李东深深叹了口气。
他已经完全排除了这两个方向。
剩下的只有最后一条路了……
就在这时候,他的手机响了。
电话是威滕打来的。
“李东教授,我明天就要回普林斯顿了。”
“杨先生和我一起研究的那道命题,你如果有兴趣,我随时欢迎。”
“威滕教授,我发现了一些东西,但现在还不确定。”
“等有了一些进展以后,我再和你沟通。”
电话那头威腾教授轻咦了一声。
“你也发现了有趣的东西?我也发现了一些有趣的东西,看来到时候咱们真的好好交流下。”
“好的,威滕教授。”
李东和威滕聊完以后,就挂了电话。
可正当他准备好好看看,中微子到底在路途中出了什么问题的时候,电话又响了。
这一次是高稳打来的。
“李东啊,今晚有场晚宴,燕大牵头的,主要是关于未央往通用大模型走的一些事情。”
“通用大模型?”
要知道,市面上的通用大模型,底层靠的是概率拟合,输出什么取决于最可能的下一个词。
而未央不一样,它的每一步推理都必须过形式化核验器的类型检查,靠的是可验证的奖励信号来修正自己。
换句话说,它是被机器判对练出来的,而不是被人类偏好喂出来的。
如果这套底层逻辑往通用场景迁移,意味着它给出的推理链,是可以被逐步追溯和核验的,这在通用大模型里,几乎是不存在的东西。
高稳那边时不时还能听到喇叭声,像是在开车。
“对,因为我们知道它的优势,所以想往通用大模型靠拢。”
“所以这次圈子里一些厂商的人会来,学校的意思是想听一听他们那边的想法,想让你也一起过来把把关。”
“未央没挂你的名字,但这块核心是你的。”
“学校也希望听听你的意见,到时候如果觉得合适,我们商量一下和这边有没有合作的空间。”
“毕竟通用大模型这个东西,想要做得长久,是真的非常烧钱的。”
这话没有半点夸张。
通用大模型的训练成本从来不是小数字。
即便只是中等规模的一次全量训练,光是算力租用这一项,就不是普通高校科研经费能够轻松覆盖的。
燕大自己做,算力成本、数据成本、工程人力成本加在一起,压力其实很大。
所以学校想和外面的厂商聊聊,这件事本身没什么问题。
李东看了看时间,已经下午了。
他又看了看桌上的那条中微子数据曲线,第三条路还没开始走,回来再看也一样。
“行,我去。”
……
晚上七点半,老张把黑色轿车停在了澜湾酒店的门口。
李东下车的时候发现外面已经站了不少人。
除了北行的李总他认识以外,旁边站的人他大多不认识,只不过他也在一些科技板块上见过。
见李东下了车,这些人笑着迎过来,挨个和握手。
“李东教授啊!真是年轻有为呀。”
“久仰久仰,李东教授如果有空可以来我们公司参观参观……”
他们大多都说着恭维的话,李东现在的身份已经不是一个学生了,他是燕大和水木两所顶尖院校的讲席教授,这些人虽然可能求不到他,但是场面话又不花钱,多说总是没错的。
李东也一一点头后就跟着众人进了酒店大厅。
大厅里已经有不少燕大和水木的教授。
唐杰教授在人群里看见了李东,走过来将他叫到了一个没人的角落。
“李东教授呀,未央通用大模型的测试版你试过啦吗?”
李东别说试过了,他连未央出了通用大模型测试版也是今天才知道的。
“我还没有,唐教授试过了?”
“嗯试过了,能力很出色,这不用多说。”
他顿了一下,然后说:“但如果是要往通用方向走,有几个地方,现在看来还不够。”
李东说:“说说看?”
“我先说好的地方。”唐杰说道。
“凡是有标准答案、靠硬推理的榜单,它都强得离谱,简直可以说是断层领先。”
“而且,我很意外他在SWE-bench上的表现也是出人预料的好,几乎也是断层的水平。”
SWE-bench测试的不是大模型单独写代码的能力,而是把模型直接扔进一个真实的开源项目里,让它读懂整个代码库,再去修一个真实存在的bug。
这玩意儿吃的是长链条的推理能力,一步错,后面全错。
通用模型在这张榜上普遍吃力。
未央能在上面取得好成绩,其实并不意外,未央的底子就是一步一步可核验的推理,它天生不爱跳步,也不爱瞎编,这习惯挪到代码上,反而成了优势。
“但是,”唐杰话锋一转,“另外那些榜,就不太好看了。”
“最明显的是Chatbot Arena。”
这张榜在大模型圈子里份量很重,它考的不是谁算得准,是真实用户更愿意跟哪个模型聊。
因此并没有标准答案,打分的不是机器,是一个一个的活人,凭感觉投票。
全球的大厂为了在这张榜上有好名次,会专门做一道叫RLHF的工序,反复拿真人的偏好去打磨模型,让它学会怎么把话说得让人舒服。
未央在这张榜上的名次,低得几乎可以忽略。
“它太死板了。”
“你给它一道题,它的推理无懈可击,可你换个方式问同一件事,它就不一定能灵活地调整切入角度。”
“它的训练信号从来不是人类喜不喜欢,是核验器判它对不对,所以它压根没学过怎么揣摩人话。”
李东在心里想。
“唐杰教授,你说的没错,但那时因为我没时间去优化这些,额……小黑没时间,算了,反正我没时间就是小黑没时间!”
上一篇:我家艺人太没上进心了
下一篇:挨打永久加防御,神魔都打不动我