我的学习群里全是真大佬 第496章

第421章 未央

  与此同时,国内某家大厂的会议室里。

  几个人围着长桌坐着,幕布上还显示着那几张有些刺眼的跑分榜图。

  “不得不承认,这一回他们是真上了个台阶。”

  一位高管叹气说道。

  “不是从前那种小修小补,是模型的能力比起上一代有了质的飞跃。”

  桌上一时间没人接话。

  过了好一会儿,一个技术负责人才开口道。

  “我听说……之前李东教授好像和他们沟通过很久,时不时林东教授给他们指的路?”

  这话一出,好几个人都看向了他。

  “消息准吗?”

  “传得有鼻子有眼的。”

  “反正这半年,他们进步这么快,你要说背后一点说法都没有我是不太信的。”

  “要不……咱们也去请请李东教授?”另一个人试探着提议道,“咱也是华夏的本土企业,他总不能光顾着帮外人吧,再说了,真要谈钱,咱给他一个合适的价格就是了,咱们又不差钱。”

  这提议一出口,在座的纷纷点头。

  事不宜迟,散了会,几个人便各自动用起手里的关系,变着法子去联系那位李东教授了。

  ……

  而被联系的最多的自然就是北行的李总。

  这两天他这部手机就没消停过。

  “喂?……哎哟,这事啊,我手上真没有李东教授的电话呀。”

  “之前是联系过,可人家早换了号了”

  “转达?我上哪儿替你转达去……”

  接到第五六个的时候,李总直接就关机了。

  他是真的服了。

  这帮人,当他是傻子吗?

  他要是真能联系上李东,他自己会不联系?

  北行又不是没有大模型。

  所以他是真的联系不上。

  电话不是没人接,就是不再服务区……

  他甚至还托了燕大的几个熟人去打听。

  得到的回答都是,最近没见过李东的人。

  没见过人?这种回答骗骗别人还行,他怎么可能信。

  肯定是李东不愿意见他们而已。

  想到这里李总只能独自叹了口气,又看起了国外的科技新闻。

  ……

  就在“国外AI即将统治世界”的言论愈演愈烈的时候。

  某天,FrontierMath第四级的榜单,悄悄地刷新了一下。

  一个陌生的大模型出现在了榜单的首位,它的名字叫做——未央!

  它背后跟着的数字是73.4%。

  这是个什么概念呢?

  那个吹牛逼最厉害的gpt-6也才跑了48.7%。

  这已经不叫领先了,这叫断层。

  前面那个一骑绝尘,后面一群人连它的影子都够不着。

  最开始,没人把这个数字当真。

  跑分榜上闹乌龙,又不是头一回的事。

  多半是哪个新模型钻了题库的空子,要不就是评测脚本出了岔子,再不然,就是有人在背后刷榜……

  技术论坛里清一色全是这类的猜测。

  于是有好事者,拿着公开的那部分题目,自己动手复了一遍盘。

  结果这个数据居然是真的!

  紧接着,又有人在另外几张榜单上,看见了未央这个名字。

  PutnamBench,那六百七十二道用Lean形式化写就的普特南竞赛题,排在最前面的,从来都是那几个烧钱烧到上千美元一道题的家伙。

  而未央挂上去的成绩,是六百七十二道,全解。

  一道不落,且每一道题后面,都有一份机器当场就能验过的完整证明。

  然后在大家吃惊的时候……

  miniF2F上的四百多道奥赛级的形式化题目,也被它清了个干干净净。

  这两张榜,向来是机器证明这一脉的试金石。

  它们的题目虽是公开的,证明却必须一步一步由机器亲自验过,才算数。

  在这种地方,你糊弄不了任何人,蒙也蒙不过去。

  所以消息很快就在AI圈和数学圈里,一同传开了。

  谁也不知道这“未央”是打哪儿冒出来的,更想不通它凭什么能在这几张榜上,把所有人都甩出这么远。

  不过这种公开的跑分的大模型到底是哪家的总是有办法查到的。

  所以很快就有人把它给扒了出来……这模型出自燕大。

  燕大?

  要知道,上一个从华夏的大学里走出来还在国际上闯出过名号的大模型,还是智谱。

  可如今这个未央看起来好像比智谱还要凶的样子。

  不过很快就有眼尖的人注意到,未央并非张张榜单都拔尖。

  在那张衡量综合智力的Artificial Analysis指数上,在比拼对话偏好的Chatbot Arena上,在考较编程的SWE-bench、考较多模态的那一类项目里,这个未央要么名次平平,要么干脆连个影子都找不着。

  很显然,这压根就不是一个什么都会的通用大模型。

  它更像是一个专为数学而生的大模型。

  所以很快所有人都第一时间跑去燕大的官网,想看看燕大有没有什么消息。

  果然……

  燕大的官网上面一条置顶通知出现在了大家面前。

  【关于“未央”数学大模型开放公测的通知】

  【各位同仁、各界朋友:】

  【“未央”,是一款面向数学研究的专用大模型,为“AI for Math”而生。】

  【不同于以拟合见长的通用模型,未央以精确的符号推理为根基,所给出的结论,均附有可由机器逐步核验的证明,它擅长在庞大的符号与数据空间中做有引导的检索,擅长大规模恒等式的精确验证,也可以作为定理形式化与证明书写的可靠助手。】

  【我们希望,它能成为数学工作者手边一件趁手的工具,替诸位分担那些繁重而严苛、半点差错都容不得的演算。】

  【现开放公测,诚邀各界前来体验。】

  【燕京大学项目顾问:田刚高文稳姚先生等】

  这则通知AI圈自然是被震动了,因为“以精确的符号推理为根基”他们根本没听过呀,这时啥?

  就在他们懵逼的时候,数学圈的反应就更大了。

  “AI for Math”这个说法,数学家们其实并不陌生。

  前些年也不是没出现过打着这旗号的模型,可那些东西,大多只能做做最初等的活,真到了深处,那保准出错。

  所以一直以来,数学家们对AI的态度,都拧巴得很,想用,却又不太敢信。

  毕竟,把自己几年的心血,押在一个张口就可能胡说八道的东西上,谁也没那个胆子。

第422章 全部核验通过

  可这一回的情况,好像有那么一点不一样。

  因为燕大这份通知的末尾,挂着的是田钢、高稳,甚至还有姚先生的名字。

  田钢在华夏数学界的分量,是不需要解释的。

  他的名字出现在这里,几乎就等于在替这个模型背书了——它在数学上,至少不是一个只能看的花架子。

  而高稳和姚先生往那一站,又让人知道这个大模型绝对不会是钻漏洞的野鸡模型。

  最后再配上那几张断层式的榜单,不少数学家心里已经泛起了嘀咕。

  难道说,这一回真出了一个数学上能用的大模型?

  当然,也有人压根不信。

  “别逗了,AI幻觉到现在都没法解决,拿这种东西当科研伙伴?我反正是不敢信的。”

  “就是,你们倒是说说看如今数学的顶刊里,哪一篇论文挂过一个大模型的名字?”

  这话一出口,他们自己都先笑了。

  “跑分嘛,就是个娱乐,竞赛题再难,那也是有答案的。”

  “等它哪天把一个没有答案的真问题做出来了,再来跟我谈什么科研伙伴吧。”

  这些年被AI坑过的数学家,想让他们再信一次AI确实比较难了。

  这些风波,李东自然都知道。

  但是这和他没有半点关系。

  因为通知上那一串名字里,压根就没有他。

  倒不是他淡泊名利,而是这事多少牵扯着点小黑,他不希望太多目光落在自己身上。

  不过名字可以不挂,但钱一分也不能少。

  模型公测之前,他就和学校还有田钢他们把账算清楚了:技术许可挂在学校名下,往后未央的每一笔进项,都按协议给他分成。

  所以外面吵成什么样,他是真没空管。

  因为此时他正和彭罗斯还有莎拉在做一件很重要的事。

  顶刊里没有一篇论文挂过大模型的名字?

  废话。

  那是因为我之前没出手。

  ……

  燕大,理科一号楼,三楼的一间研讨室。

  窗帘拉了大半,投影幕布上是一条缓慢向上曲线。

  李东、彭罗斯和莎拉三个人已经在这间屋子里待了好几天了。

  他们面前的白板上写着一行字。

  【已验完十一万条恒等式】

  这几天里,彭罗斯每天早上都会拎着三份早餐准时出现,莎拉则是将未央给出来的每一个结果,都抄在了本子上,好像生怕丢了一样。