我们的文明已然掌握怎样把沙子转变为硅芯片 , 把硅芯片转变为神经网络了 , 又把神经网络转变成人工智能呢。在过去的五年之中 , 大型语言模型人工智能 , 像GPT以及Gemini这类 , 其能力已从刚开始学步的幼儿提升到国际数学奥林匹克金牌得主那般的程度了 , 而现在更是超过了这个水准。
不久前, Gemini的核心做出贡献的人, Blueshift团队的负责人Adam Brown, 最近在圆周理论物理研究所进行的一场篇幅很长的演讲, 名为《训练沙子思考: 通用人工智能与物理学的未来》。这场演讲引起了广泛的留意。在这个演讲里, 他讲了自己怎样亲眼看着人工智能从“幼儿园的程度”一直快速发展到博士的程度, 由此进行推断: 要是这种趋势持续下去, 物理学会变成什么样。

视频链接:
https://mp.weixin.qq.com/s/p3l4kSgB0k2I11ji3kkBLQ
诺贝尔物理学奖得主Geoffrey Hinton大力推荐了该演讲,将其赞为「精彩绝伦(amazingly good)」, 这位Geoffrey Hinton还是图灵奖得主。

在着手讲解这个极其精彩、无与伦比的演讲之前, 有必要先对那个名为亚当·布朗(Adam Brown)的演讲者进行一番介绍。

布朗有着这样一份履历, 这份履历可被堪称是一部样本, 一部关于「理论物理学家如何被AI改变命运」的样本。他在牛津大学就读, 读的是物理与哲学的联合学位, 之后呢, 又在哥伦比亚大学成功拿到博士学位, 再往后, 还先后在普林斯顿大学以及斯坦福大学的物理系任教。他在斯坦福, 教授称为爱因斯坦广义相对论的内容, 其研究范畴涵盖大爆炸, 宇宙暴胀, 多重宇宙, 黑洞, 量子计算, 还有听起来仿若科幻小说情节的「太空电梯」与「虚无泡泡(bubbles of nothing)」, 以及宇宙的终极命运, 并且他长期留意物理学跟计算机科学之间的深层次联系。
在2018年的时候, 布朗进入了谷歌。到了如今, 他带领着DeepMind内部一个叫做Blueshift的团队, 这个团队专门致力于提升AI的科学以及推理能力, 并且他还是Gemini大模型的核心贡献者当中的一员。
在演讲开始的时候, 他讲起自己职业经历中写过大概四十篇理论物理领域的论文, 然而近些年已经停下书写, 不再通过手写来完成论文了, 不过原因并非是写不出, 而是他认为逐篇手写论文, 更像是一种“罪恶的享受”, 因为目前他真正应该去做的事情, 是投入到制造一台能够“以工业规模”产出知识的机器当中。
这般开场白, 同样给整场演讲设定了基调: 有一个身处于「AI + 科学」技术狂风卷入中心之地的人, 尝试着前往向同行们去描绘风暴实际呈现出来的形状。
在 AI 的辅助状况之下, 是由我们来做的, 针对布朗这份呈现出精彩特质的演讲, 展开了归纳以及总结的相关行为。
从沙粒到会思考的机器
布朗概括了人类文明此刻所处的特殊位置, 他表示, 我们已然学会将沙子提纯为硅, 把硅制作成芯片, 把芯片组装为神经网络, 且现下又掌握了训练这些神经网络去思考 的技能, 用一句话阐述了这一情况且标点符号为句号而不是冒号。
他着重指出, 此次与以往的任何一种“计算工具”皆存在差异。自算盘至袖珍计算器, 人类曾拥有各类辅助科学研究的工具, 而那些均为单点工具, 仅能帮你达成流程中的某一步骤, 余下的依旧需人自行完成。
大语言模型, 也就是LLM, 并不同于其他, 它有着能够完成理论物理学家全部工作流程的一种潜力, 而这恰恰就是「通用智能」, 也就是general intelligence这个词所表达的含义之处。布朗经过判断后得出, LLM极有可能就是人类用以构建通用人工智能所需要的底层基质。
他向听众发出提醒, 大家或许已然使用过GPT、Gemini或者Claude这类聊天机器人, 然而却不一定察觉到一桩静静发生的情况, 这些系统实际上早在几年之前就已经暗自通过了图灵测试, 并且几乎没有什么人专门针对此进行庆祝。

神经网络是「养成」的,不是「编写」的
要明白大模型为何跟传统计算机程序全然不同, 布朗给出了一个关键比喻, LLM不是被编写出来的, 而是被培育产生的, 意味着它们更像是被培育着成长起来的, 而非被编写而成的。

具体过程分为两个阶段。
首先, 第一阶段称作「预训练」, 工程师们起始于一组随机存在连接、近似于乱语状态的人工神经元, 使其持续尝试去预测一段文本之中「下一个词」究竟会是什么。要是猜对了, 便去强化与之对应的神经通路;要是猜错了, 那就减弱它。这里面的过程极为漫长: 当看过一百万词的时候, 模型讲出来的话语基本上依旧是胡言乱语;在读过几千万直至几十亿词以后, 它已然能够写出语法无误但呈现出稍显生硬态势的句子;一直到读完整个互联网(几十万亿词), 它才能够针对几乎任何话题去进行流畅、连贯地对话。
称做「后训练」的第二阶段, 布朗将其描述成把模型「送进礼仪学校」。刚完成预训练的模型只会机械地预测下一个词, 讲话粗俗又不服管束, 后训练的任务是教导它变得彬彬有礼、变得乐意配合用户, 而非仅仅进行接龙文字游戏。现今主流大模型参数量已从十年前的十亿级攀升到几万亿级, 尽管依旧远低于人脑大约百万亿个突触连接的规模, 可这个规模已足以让奇迹出现。
物理学家不务正业:Scaling Law 点燃了这场革命
布朗专门指出, 物理学家于这场AI革命的起始点处, 发挥了一个出人意料的作用, 那便是带来了名为「Scaling Law」的思维方式。
身具探索简单幂律关系之天然痴迷的物理学家, 将爱丽丝身高翻倍, 其体表面积变为四倍, 体重变为八倍, 此为最简量纲分析, 而近百年前克莱伯发现的动物代谢率与体重的幂律关系, 是更微妙例子, 多年后物理学家才用血管系统分形维度解释其背后原理。

更别说著名的摩尔定律了:

2020年, 有几位有着物理学背景的研究者, 将这种思维方式迁移到神经网络上, 他们发现, 倘若把训练时所用的算力、数据量以及模型规模按照比例予以放大, 那么模型在“预测下一个词”这项任务上的表现,会沿着一条处于对数 - 对数坐标系下的直线, 稳步地提升。

这条曲线后来被拓展了整整八个数量级开运真人app下载苹果版,开运真人app下载,依然成立。
这张图, 布朗调侃称其简单得就连风险投资人都可看懂, 它能够径直告知资本市场, 将钱, 也就是算力投入进去, 便能够换来更强的模型。
这条简单的曲线,正是过去六年 Scaling 时代的起点。
然而布朗亦表明, 算力进行堆量仅仅是故事的其中一部分, 在过去的十年时间里, 前沿AI训练所耗费的算力每年大概是以四倍的幅度在增长, 训练投入的资金每年大概是以2.7倍的幅度在增长。

当下, 一次顶级训练所需的算力, 大概需耗费数亿美元。美国全年的 GDP 将近三十万亿美元。这表明这条曲线存在非常长的增长余地。

然而, 相较于堆砌算力而言, 更为关键重要的是, 人类于算法领域层面所进行的持续不断打磨: 从事研究的人员们持续不懈地寻觅探寻出训练流程之中存在的缺乏效率的环节部分, 并且针对其予以改进优化, 这便是在过去十年间人工智能取得进步发展背后真实存在的真正意义上的“第一推动力引擎”。
基准测试的「短命史」:从学前班到博士
假设Scaling Law阐释了「为何AI会朝变强的方向进阶」, 接连不断的基准测试之起起落落, 便记载了「AI变强至何种地步」, 布朗借一组测试结果, 勾勒出一条致人目眩的曲线。
四年前, 有个叫MATH的高中数学题基准测试出现了。研究者找了个不太擅长数学的计算机科学博士生去应试, 其得分约40%。研究者还找了一位三届国际数学奥林匹克金牌选手应试, 得分是90%。至于当时最先进的大模型, 只拿到6%, 这几乎和瞎猜没差别, 为啥? 因为模型甚至读不懂题目问的啥。
当年那些进行预测的市场觉得, 到二零二五年的时候, 模型所取得的成绩要是能够达到百分之五十, 那可就已经算是「狂妄的乐观」了, 而基准测试的创建者他自己则公开宣称, 要是确实有模型能够达成这一情况, 那他会感到「相当震惊」。

结果, 这个百分之五十几乎是「立刻」就被一个叫做 Minerva 的系统跨越过去了, 到二零二四年年中, 布朗团队的系统在该基准上取得了百分之九十的成绩, 他们甚至特地去举办了一场九十年代风格的轮滑迪斯科派对来庆贺, 然而仅仅六个月过后, 市面上现成的大模型近乎满分地解答了这套题目, MATH 基准测试就此「消亡」, 并且它从「太难」直接跃到了「太容易」, 中间几乎未有停顿。

接下来, 倒下的是面向研究生开展的 GPQA 测试, 它模拟博士第一年资格考试的难度, 对于此测试, 人类专家的平均分约为 70%。该模型起初从接近随机猜测的状态起步, 在 2024 到 2025 年这一时间段内, 一路突破达到专家水准, 如今几乎能拿到满分。为了排除 「模型只是把答案背下来了」这种可能性, 布朗团队专门设计了互联网上未出现的同分布新题, 最终结果是模型表现几乎没有下降。

布朗, 甚至, 还拿出了自身于斯坦福亲手批改的广义相对论以及量子力学研究生期末考试, 这些题目, 从未在网络上出现过, 结果, 那模型同样是在一年半的时间之内,拿到了满分, 他, 半开玩笑一般地讲, 这下, 就连他自己所出的考题, 也, 「不幸战败」了。

从此以后, 倒下的基准测试名单持续见长, 越来越多, 其中涵盖了曾经被称作「人类的最后考试」(Humanity's Last Exam)的超难度综合测试。

而最具标志性的一次跨越,发生在国际数学奥林匹克竞赛上。
跨过奥数的门槛
在一年多以前的时候, 有一位获得图灵奖的得主, 曾经在面对面的情况下告知布朗, 大型模型始终都没有办法去解答国际数学奥林匹克也就是IMO级别的题目, 原因在于那是需要具备真正的创造力才行的, 可不是依靠死记硬背就能够蒙混过去的。国际数学奥林匹克的题目是以“高中数学范畴内难度最大的题目”而闻名的, 全世界当中最为聪明的十几岁的少年, 需要进行一两年的训练才能够参加比赛, 在六道题目里面要是能够拿到金牌那是极其稀少的。

去年夏天, 这道门槛被跨越了。布朗团队的系统, 在IMO级别测试里, 六题答对了五题, 达到了金牌的水准。并且, 该系统并非依靠堆砌一长串无人能够看懂的形式化证明来蒙混过关。对于这些解答, IMO主席在公开评价时表示, 它们「在很多方面都令人感到惊讶」, 评卷人觉得它们清晰、精确, 大多数都易于理解, 采用了与人类较为相似的数学抽象方式。
布朗也坦率展示了大模型的「翻车现场」。

一个堪称经典的脑筋急转弯是这样的: 父子俩遭遇了车祸, 父亲不幸身亡, 孩子被紧急送往手术室。担任主刀的医生看到男孩后声明「我不能为他实施手术, 他是我的儿子」, 就此问题来问众人这究竟是怎么一回事(标准答案是医生是男孩的母亲)。此道题目所考验读者的是, 是否会默认外科医生必定是男性这一情况。大模型对于这道成为「网络爆款的题目」回答起来显得游刃有余, 原因在于它在训练数据当中已经见过成千上万次。可是, 当布朗将题目进行反转, 也就是母亲去世了, 医生被特意注明是「男孩的父亲」, 之后再去问同样的那个问题时, 模型却全然没有察觉到题目已然反转, 而是机械地去套用了「医生是另一位家长」的标准答案。
布朗说,这暴露了模型训练方式留下的一种特有的「癖好」。
人马合作:AI 写出数学家愿意联名的证明
十个月后, 布朗团队跨过了IMO门槛, 完成了一项工作, 这项工作他认为意义更重大: 是真正的数学研究, 此前无人知道其答案。
去年九月, 布朗团队跟几位职业数学家展开合作, 运用他称作「半人马式」(Centaur)的协作模式, 半人马是希腊神话里那种半人半马的生物, 在这儿, 「非人的那一半」被换成了LLM。

整个过程呈现为一场持续不断进行着的对话, 首先是模型提出了候选证明思路, 接着人类专家对这些思路进行判断, 分辨出哪些是具有价值的, 随后引导模型继续朝着深入的方向发展, 最终借助人类的指导完成了一篇结构规整的数学论文。在这篇论文中, 有一位合作者, 他是斯坦福大学的教授, 同时也兼任美国数学学会的现任会长。这位教授给出了这样的评价, Gemini所提出的论证绝非仅仅是对现有的证明进行简单的重新包装, 而是一种就连他本人都会引以为自豪、令其内心充满骄傲的洞见。
布朗着重指出, 在那时候(去年年末), 这已然就属于大模型于数学范畴内能够达成的最为顶尖的水平了。然而, 他紧接着便增添了这么一句话: 要是谈到「最高水准」的实际含金量, 这二者之间的差距可着实是非常大的。
真正的转折点:AI 独立攻克尘封八十年的猜想
到了2026年, 形势发生急剧变化, 究竟是急转直下, 亦或是说是急转向上呢。布朗以一句差不多是带有挑衅意味的玩笑话语作为开场, 说道: 「就在上一周, 那个大规模语言模型可从来都未曾达成过实实在在具有重大意义的数学突破成果。」而现阶段, 这样的陈述已经不再是真实情况了。

有这样一个大事件, 很多人已然听说过了。埃尔德什于1946年提出的「单位距离猜想」呢开云app官方入口网站,八十年来数学界普遍觉得正方形网格构型就是已知的最优解。而OpenAI内部有个大模型独自给出了一个反例, 它借助代数数论里的工具,构造出了一系列点集, 这些点集的单位距离对的数量超出了此前公认的上限。这就等于是把这一长期被当作真的猜想给推翻了。

值得一提的是, 这个题目并非冷门, 在此之前有许多人进行过尝试, 只是数学家们耗费了大量精力, 却始终在「证明」而非「反证」的方向上徘徊, 这是个难题。布朗专门提及, 菲尔兹奖得主高尔斯参与了对这一结果的复核工作, 且给出了极高的评价。
布朗作出判断, 这属于大模型于数学领域所获取的首个具备真正切实意义的重大突破之处。并且, 他持有这样的看法, 即这绝对不会是最后一个。他声称, “闸门已然打开”。伴随模型自身实力持续不断地超越“制造突破所需要达到的门槛”, 他预估在接下来的时间里, 将会有更多诸如此类的成果接连不断地涌现出来。
他, 是以半开玩笑的方式来补充的, 回过头去瞧一瞧, 会发现这道题之所以可以领先被攻克下来, 大概原因, 是它的题目结构刚刚好就踩在了大模型的“舒适区”里头;紧接着, 模型会先着手解决那些“对AI友善型”的难题, 然后再一步步地去攻克那些“不怎么友善型”的难题。
国际象棋给出的预言
布朗拿出一张曲线图, 为的是让听众相信这条曲线仍会持续上扬, 这张图乍看像是随手画的, 是一条持续向上攀升的直线, 并非他凭空绘制, 而是直接取自国际象棋计算机棋力随时间变化的真实数据, 在此数据里, 纵轴是衡量棋力的Elo等级分, 横轴是年份。

布朗梳理出国际象棋 AI 历史上的四个阶段:
布朗认为,这四个阶段在科学研究领域几乎可以逐一对应。

第一个规律是, 在同样的综合实力状况下, 计算机会在战术以及搜索速度这两方面胜过人类, 然而在战略、“品味”判断方面依旧显得薄弱。这刚好也是当下大模型在数学与物理研究里所展现出的特征, 它们善于运用既有的引理和技巧, 不太善于判定“整体方向该朝着哪里去”, 不过这一不足之处正在迅速缩小。
第二个规律是, 训练下AI棋时所需“经历”的对局数量, 远远超过人类一生所能下的棋局总数, 然而, 因能够做到不知疲倦地高速自我博弈这一情况, 实际所需的“日历时间”, 远比训练一名人类棋手的时间短得多。
第三条规律是, 计算机棋力一旦超过人类巅峰水准, 便再也未曾停下, 毕竟不存在任何物理或者逻辑方面的缘由致使它刚好停在人类水平周边。
第四个能让人感到安慰的事实是, 国际象棋AI的兴起反倒提高了人类棋手的总体水平, 如今最强的人类棋手比以往任何时候都更厉害, 部分原因正是借助向超厉害的AI学习, 并且国际象棋这项活动本身, 也从来没有像当下这般受欢迎。
布朗所给出的暗示清晰无疑, 那便是倘若科学研究依照这条轨迹延续下去, 人类最先极有可能会迎来具备完全自主性的「AI 科学家」, 在此之后则会出现某种层面上的「AI 爱因斯坦」……而在这之后还会发生些什么, 他坦诚表示已然超出了他自身能够进行预测的范畴。

哪怕进步就此止步,物理学也已经被重塑
布朗还提出了一个需要予以警惕的「悲观假设」, 那要是大模型的能力从当下开始完全保持不进展不前的发展态势不再进步 会有怎么样的后续发生演变呢 是吗?

他直接表明, 当下实际「无法行得通」的运用方式, 乃是直接对着模型讲「请为我创造出一套全新的量子引力理论」;如此来获得的答案, 大概仅仅是些没有价值、读起来会让人感觉昏昏欲睡的「AI废话」。
比较普遍来讲, 当下大模型依旧存有四个显著不足, 分别是自主性较为低下, 学习速度相对迟缓, 规划能力比较差劲, 纠错能力较为薄弱。

布朗坦承, 这四项短板, 在过去一年, 都有显著改善, 然而, 无一彻底被解决, 所以, 一个能在每个学科的研究生考试当中都拿到满分的系统, 却一直迟迟没能拿出能够被称作「重大突破」的成果。
当他着手筹划这场演讲之时, 他特意将这一要点绘制成一条标着问号的“平直曲线”, 以自嘲的方式承认这大概是整场演讲当中唯一一张“未呈现持续上扬态势”的图表。然而, 他又补充表明, 在2026年还未结束的时候, 众人恐怕就要展开关于“重大突破”这个词汇究竟该如何界定的争论了。实际情况显示, 这一天的到来比他自己预先设想的更为迅速。
然而, 就算进步确实定格于当下, 布朗却觉得大模型已然足够彻底变革物理学研究的整体面貌。
他列出了几项早已成熟、且仍在持续进步的用法:
布朗总结称, 大模型的核心优势在于, 它速度快, 它覆盖面广, 它不知疲倦, 它还能够被无限复制。培育一名物理学家需耗费几十年时间, 然而一旦训练出一个强大的模型, 便能够同时运行成千上万个副本, 这已然足以“彻底改变”这门学科了。
结语:物理学的黄金时代
在演讲的最后世界杯直播,布朗给出了他对「为什么进步不会停止」的判断。

首先, 从宏观经济的角度去看, 当下投入到训练之中的资金, 在全球GDP里所占的比例截至目前依旧是非常小的, 进而留出的增长空间仍旧是极为充裕的;其次, 从技术自身的内部来看, 当下训练大模型所采用的方法, 远远没有呈现出来的那般精妙;再者, 诸多明显可见、然而却还没有被认真地去尝试过的改进思路, 依旧有待于被挖掘;最后, 再加上持续不断涌进这个领域的人才以及算力, 布朗据此判断, 当前的模型架构以及算力规模, 已然足可是通向通用人工智能的, 哪怕是没有全新的理论突破。
一种流传已久的悲观论调是, 大模型只会「模式匹配」、无法产生真正的新想法, 他也对此作出了回应。

布朗持有这样的看法, 即要是把抽象的层次拉升到足够的高度, 那么几乎是所有看上去好似「重大突破」的人类创造之成果, 在本质方面其实也是某种处于更高维度的模式匹配情况。在这个领域, 有一句一直在反复被印证的行话, 那就是: 「这些模型就是想要去学」, 不管从理论角度而言有着多少似乎合理的理由表明它们理应学得不好。但是它们的表现却总是能够超出原本的预期。
有个结论是由布朗所得出的, 那就是在紧接着到来的几年时间里, 我们将会迎来一个人类跟AI一起协作的所谓“半人马”的黄金时代, 这个意思是, 那些具有工具性质的事物会被放置到人类物理学家、数学家以及各个领域专家的手里, 然后一起去开启一场属于科学与数学领域的全新的文艺复兴。
在那之后, 要是“制造出一个人工智能爱因斯坦”这种事情切实达成, 鉴于复制一个训练完备的模型基本无需额外付出成本, 人类极有可能很快就会有数十亿个“超人级人工智能爱因斯坦”同时运行。这听上去仿若科幻小说里边的情节, 然而却正在真实上演。

布朗讲道, 从长远角度而言, AI究竟会引领物理学朝着怎样的方向发展, 他跟所有人一样, 难以进行预测。他进而觉得, AI能力的持续不断提升, 正在致使整个世界的未来愈发难以预测。然而有一点他能够确定: 在接下来的几年时间里, 将会是物理学历史上最为激动人心的一段时期。那些困扰了他整个职业生涯的诸多问题, 他预估在并不遥远的将来, 会逐一得到解答。
还木有评论哦,快来抢沙发吧~