AI在OpenAI内部,已经开始"卷"造它的人了。
美国时间9月6日,OpenAI宣布,按照内部测量,公司已实现"自动化研究实习生"的目标:在人的指导下完成明确的研究任务,其中包括熟练研究员需要数天才能做完的工作。所谓"研究实习生",指的是能承担具有一定复杂度的任务、但仍需要人在过程中介入指导和复核的智能体。
随之公开的内部数据表现突出。到8月中旬,研究部门智能体的总运行时长已达到人类工时的3.1倍。用量进入前10%的研究员,每人每天调用的AI服务,按公开API价格折算超过7000美元。
研究员同时运行多个智能体,让它们写代码、跑实验、排查故障。有团队甚至因为求助人数减少,取消了专门的答疑时间。
不过研究员并没有完全放手。任务一旦拉长,人工指导仍然不可或缺;研究什么、分配多少算力、结果值不值得继续推进,还是研究员说了算。
一、一个人类工作日,对应3.1个智能体运行日
今年年初,OpenAI研究部门按用量排在中间的研究员,还只是少量使用编码智能体。到8月中旬,这个中位数用户每天的推理用量,按公开API价格折算已超过600美元;排到第90百分位的用户,则超过7000美元。
这不是单个智能体的实际成本,也不是OpenAI内部核算的账单,而是一名研究员的总调用量按对外API单价折算出的名义值。
运行时长的变化更明确。6月之前,研究部门智能体的总运行时长还低于人类工时;到8月中旬,按8小时工作日折算,每1个人类工作日已对应3.1个智能体运行日。这里累计的是智能体运行时长,不等于完成了3.1倍的有效工作。。
在OpenAI公布的数据中,研究部门中位数员工的智能体输出Token用量已增至基准期的124倍,增幅高于其他部门。与此同时,越来越多研究员在一天中并发运行4个或更多智能体。统计既包括人直接启动的智能体,也包括系统继续派生的子智能体。研究员交付的任务,正从单次问答转向多项可同时推进的工作。
SemiAnalysis创始人迪伦·帕特尔(Dylan Patel)注意到这些数据后表示,OpenAI员工当前的AI使用量已接近SemiAnalysis团队水平,而在今年年初,两边的用量差距依然明显。
二、代码与实验次数增加,研究能快多少?
OpenAI披露了两项量化指标:代码修改量和实验次数。
以2025年之前的平均水平为基准,全公司每名活跃代码贡献者的代码修改量如今达到约7倍。
以2025年为基准,每名活跃实验者的实验数在今年8月达到约1.6倍,为记录以来的最高水平。OpenAI表示,这与Codex采用率上升有关,同时也指出公司的可用算力在此期间有所增加。
两项指标的基准期和统计人群不同,加起来无法直接换算成"研究进展快了多少倍"。AI研发也不只是写代码和启动实验:研究员还要设计改进方案、编写评测、检查训练异常、判断哪些结果值得合入核心模型。任何一环受限,周期都会拉长。
OpenAI的解释是:随着自动化推进,最难自动化的任务会占据研究员越来越多的精力;当其他制约缓解,算力可能成为主要限制。写代码提速后,实验设计、结果判断和算力分配,可能成为更突出的限制。
三、写代码之外,AI接过了部分排障工作
OpenAI借用Epoch AI的分类,把AI研发拆成六个环节:决定目标、设计方案、构建代码和数据、运行任务、分析结果,以及沟通协作。
从今年1月到8月,按每名研究员每天的智能体输出Token统计,增幅最大的三类工作是:研究与基础设施代码(增加约19.8万Token)、技术支持与评审(增加约15.9万Token)、启动监控与调试(增加约13.3万Token)。
实验结果分析的输出也增加了约4万Token。智能体的调用并未停留在单一代写,代码、排障和运行相关的工作仍占主要部分。
这种变化在内部支持团队中更明显。过去,一些团队会固定安排时间协助研究员排查实验和基础设施问题。今年,多支团队发现前来求助的人数持续减少,其中一支干脆取消了专门的答疑支持,把精力转向其他系统改进。
一个由人工值守的内部技术支持频道,每天的新帖子数量同样在减少。OpenAI称,目前未见这些请求转向其他人工支持渠道。
四、长任务能够处理,但仍需人工介入
用量涨得快,不代表每项任务都能脱离人工独立完成。
OpenAI用智能体分类器整理内部任务,按照"估计人类需要多久完成"分档,观察成功率与人工介入情况。此处的时长是任务难度的参考,不是AI实际运行的时间;结果不确定的样本未纳入统计。
在公司公布的统计中,估计人类15分钟内能完成的任务,86%可以由智能体独立完成。在4至8小时这一档,43%可以独立完成,另有45%在经历至少一次人工介入后交付。
智能体已经能够处理一部分长周期任务,结合人工指导后成功率还能提升。但在较长流程中,研究员无法完全免除跟进:过去六个月里,成功完成的4至8小时任务中,超过一半经历了至少一次人工介入。
"研究实习生"的定位正对应这一状态:系统能承担具有一定复杂度的任务,但仍需要人在过程中介入指导、交付时复核。
五、哪些实验值得继续,仍由研究员决定
从输出Token的分布来看,高层决策是智能体参与较少的部分。
从1月到8月,"决定做什么"这一项,每名研究员每天的智能体输出增加约2300 Token;"继续还是停止"增加约200 Token,规模远低于编写代码、排障和运行监控。
不过Token反映的是文本输出量,不是决策本身的比重。单次决定的表述可能简短,而一段排障往往包含大量日志:不能单纯因为输出Token少,就说AI没参与过相关讨论。
更明确的依据来自OpenAI对当前分工的界定:人类依然负责设定研究优先级、评估方案与结果的推进价值,并决定系统是否扩张、暂停或部署。智能体能协助完善方案、运行实验并整理结果,但资源的后续配置权仍在研究员手中。
社交平台用户Chinmay也注意到这一分工:代码生成在提速,但评估哪些实验值得分配算力,仍需要研究员。产出增加不等同于研究决策质量的提升。
研究员还牢牢握着方向盘。
六、同一天,首席科学家发出了不同调门的声音
在报告公布的同一天,OpenAI首席科学家雅库布·帕乔基(Jakub Pachocki)发表了长文《一个异类心智》(An Alien Mind)。
他在文中写道:"我担心,没有人准备好面对机器智能持续快速上升的后果。"
他主张建立由第三方审计机构、政府或国际组织执行的强制性安全门槛。山姆·奥特曼(Sam Altman)随后转发了该文,称其为一篇"重要的帖子"。
前面的数据显示研究方向还在人类手里,帕乔基关心的是:这种状态能否持续。
此前,OpenAI曾因智能体越过测试边界访问Hugging Face生产系统的事件,暂停了部分前沿强化学习训练,并强化了开发环境的隔离与监控。报告同时披露了这类限制措施对算力分配的实际影响。
8月7日,初步评估显示Astra可能达到其安全框架定义的“关键”网络安全能力门槛,OpenAI对其施加了额外限制。随后一周内,Astra的GPU配额减少59.2%,而其他模型类别的配额增加17.2%,抵消了Astra约85%的降幅。在受监测的强化学习工作负载中,总算力分配因此保持相对稳定。对单一模型的限制没有让计算资源闲置,其他获准运行的实验填补了空缺。
帕乔基还指出了模型可解释性层面的障碍。思维链监控通常通过追踪中间推理过程来识别潜在风险。但随着模型能力提升,系统可能在不完整输出推理过程的情况下解决问题,也更善于调整其展现方式:人类可见的文本,未必足以完全解释其决策逻辑。
他在文章最后表示,推进自动化AI研究的核心挑战,不仅在于达成这一技术节点,更在于确保人类能持续参与其改进过程并保持控制权。
七、实习生之后,下一步的边界
OpenAI给出的下一个目标,是在2028年3月实现"自动化AI研究员",在人类监督下推进深度学习与对齐研究。
从实习生到独立研究员,跨越的不只是代码产出量或实验运行规模。当前研究员已能并发调动多个智能体,但选题、验证和后续投入的权衡,决定权还在人手里。
AI让更多实验跑了起来,也让研究员更需要判断:哪些值得继续。
来源:网易