近年来,微软频繁提及人工智能技术:Copilot辅助编程、AI查找漏洞、自动化提升效率……然而,最近微软内部的两篇博客却呈现出不同景象,并非“AI真香”,而是“AI过多,我们难以招架”。

一方面,Exchange团队指出,AI查找漏洞过于高效,导致累积更新无法及时发布;另一方面,Edge团队承认,AI生成的浏览器扩展数量激增,审核工作已不堪重负——不到一个月内,微软两次“自揭短板”,而核心问题均与AI相关。

AI找Bug太猛,CU1被“堵”在路上

事件始于8月13日。当时,微软Exchange团队发布了一篇题为《Exchange SE CU1到底在哪?》的帖子,坦言收到大量客户询问:Exchange Server订阅版(Exchange SE)的累积更新CU1,究竟何时推出?

这一问题被反复提及,是因为微软最初承诺在2026年上半年发布,随后悄然改为“2026年下半年”,之后便再无具体时间表。

简单说明:Exchange SE是微软邮件服务器的订阅版本,累积更新(CU)是一种整合型更新包,包含近期所有漏洞修复、新功能及过时代码移除等内容。微软通常每年发布一至两次CU,部分用户也更倾向于直接安装CU,而非逐一打补丁。

对于CU延迟的原因,微软给出的解释颇为意外:AI工具发现了过多漏洞。

过去几个月,微软一直使用多种AI工具查找产品中的漏洞,但发现Bug并非终点,反而开启了一系列繁琐工作:工程师需先确认Bug是否真实存在,再尝试复现;确认后,需修改代码、测试修复效果,并进行回归测试,确保“修好一个Bug,未引入三个新Bug”;随后,还需将这些修复打包为安全更新并发布。

然而,安全漏洞并不会排队等待处理,新Bug持续涌现,安全更新每月仍需发布。于是,Exchange团队陷入一种尴尬局面:一边修复新的安全Bug,一边推进CU1工作。

更棘手的是,微软不敢轻易推出CU1。因为一旦CU1发布,若紧接着出现紧急安全漏洞,企业管理员可能需立即安装另一个大型更新,因此微软宁愿继续等待。

Exchange团队表示,他们将持续将每月安全更新整合进内部CU1版本,待版本足够稳定,并遇到一个没有“必须优先处理的紧急安全更新”的月份时,再正式推出CU1。

听起来稳妥,但问题在于:究竟哪个月份才能没有紧急安全更新?

博客最后写道:“简而言之,Exchange SE CU1肯定会发布,我们未忘记此事,但目前无法给出具体日期。”——这句话表述得体,但信息含量几乎为零。

尚未缓过劲,Edge又被AI“挤爆”

这边Exchange问题未了,另一边Edge团队又遇麻烦。

9月8日,微软Edge团队在一篇博客中承认,自身也受到AI压力的影响。博客写道:“随着AI辅助编程快速普及,开发者如今能比以往更快地构建浏览器扩展。”

以往开发一个浏览器插件,需自行编写代码、调试Bug、测试,再逐步迭代;如今不同:借助AI工具,开发者可让模型生成代码,再不断修改、迭代,快速制作出大量以往不会尝试的小工具。

于是,Edge扩展生态迎来一个微软可能未预见的副作用:提交量开始激增。

但插件进入Edge Add-ons商店前,微软不能允许它们“写完即上架”,需对扩展进行审核,检查是否违反平台政策、存在安全问题,以及是否符合质量要求。微软自己也承认,此前推出的“高质量、高价值扩展加速审核流程”,已开始承受新压力。

换言之:开发者端的AI加速器越踩越深,插件提交量持续增长,微软审核流水线负担日益加重,最终导致扩展审核周转时间延长。

面对此问题,微软并未简单扩大人工审核规模,而是继续在审核流程中引入AI。Edge团队表示,已为审核流程中许多可重复的验证检查引入自动化,并简化了审核在流水线中的流转方式。微软特别强调,这并不意味着降低审核标准,也不会减少扩展需通过的检查,只是将审核过程拆分:AI负责“标准答案”,人类负责“需判断”的复杂案例。

至于这些自动化流程具体使用了多少AI,微软未明确说明。但逻辑已显而易见:既然AI加速了前端生产速度,后端审核也需实现自动化,否则整个系统终将堵塞。

AI编码≠代码安全

不到一个月内,微软两个团队接连遭遇类似困境。

● Exchange:让AI发现Bug → Bug数量增加 → 工程师验证、修复、测试 → 安全更新不断插队 → CU1迟迟无法发布。

● Edge:让AI生成代码 → 开发者制作插件更快 → 提交量增加 → 人工审核压力暴涨 → 审核周期变长。

开发者可一口气生成10个插件,审核团队却无法一口气审核10个插件;AI可一次发现一批漏洞,但安全工程师仍需逐一确认、复现、修复。虽然一个卡在发布,一个卡在审核,但共同点在于:AI提升了上游生产效率,但下游未同步提速。

这实际上是AI编程发展到现阶段,一个日益值得关注的变化。

过去程序员的最大烦恼可能是“写不出代码”,但当代码生成从“一个程序员一天写多少”变为“一个Agent几小时能写多少”后,问题转为:这么多代码谁来测试?Bug找出来后谁来修复?插件写出来后谁来审核?修改后谁来验证?上线后出问题谁来负责……

毕竟,虽然AI让写代码更便捷,但并未让代码更安全——这两件事本质不同,目前AI无法自动消除审核、验证等后续工作。

那么,微软Exchange和Edge团队遇到的这一问题,你在日常工作中是否也碰到过类似情况,又是如何应对的呢?