#网站应用 GitHub CTO 回应本周的长时间大范围宕机,宝宝心里苦但宝宝必须说:每月代码提交次数从 5,000 万暴增到 29 亿次,资源是真不够用。今年以来 GitHub 已经新增 300 万颗 CPU 核心和 120PB 高速存储,这种扩展的规模确保 GitHub 在大部分时间保持正常。另外 GitHub 正在将更多人力资源投入到可用性方面,可用性已经成为 GitHub 最大的问题之一。查看全文:https://ourl.co/126366
本周微软旗下代码托管平台 GitHub 出现长时间和大范围故障,此次故障持续时间很长因此影响大量依赖 GitHub 的开发者和用户。昨天 GitHub 已经发布事故复盘报告,报告指出引起故障的主要原因是使用量激增引发内部基础设施错误,而基础设施也存在其他不合理问题导致故障被放大。
现在 GitHub 首席技术官弗拉基米尔・费多罗夫也发布博文再次回应这件事,费多罗夫强调本次故障的根本原因都不是代码或配置变更引起,单纯就是流量太高引起的叠加问题。简单来说就是:宝宝心里苦,但宝宝必须说出来。

每月提交量从 5,000 万次暴增到 29 亿次:
在博客中费多罗夫分享自 2023 年开始的 GitHub PR、代码提交、新存储库创建的增长数据,数据显示:在 2023~2024 年,GitHub 每月代码提交次数还只有 5,000 万次左右,到 2025 年年初有所增长但也只有 6,000 万~7,000 万次。
然而从 2025 年下半年开始每月代码提交次数以一种极为恐怖的速度增长,到 2026 年 8 月,每月代码提交次数已经增长到恐怖的 29 亿次,当然 PR 和新存储库创建数量也屡创新高,GitHub 有点顶不住了。
费多罗夫强调近期两次宕机都不是代码或配置变更引起的,两次事件的根本原因都是容量不足,GitHub 未能及时扩展关键组件,导致需求超过容量。当然这不能成为借口,所以 GitHub 正在加速迁移和扩容。
新增 300 万颗 CPU 核心和 120PB 高速存储:
为应对流量激增问题,GitHub 正在加速向 Microsoft Azure 迁移,如今 Azure 承担 GitHub 约 58% 的平台负载和 50% 的 Git 操作,远高于 5 月份的 12%。
与此同时 GitHub 也在疯狂增加 CPU 数量和存储空间,仅在今年 GitHub 就已经新增 300 万颗 CPU 核心和 120PB 高速存储 (12 万 TB),靠这种扩展的规模 GitHub 才能保持大部分时间稳定运行。
还有个 AI 时代的奇观是,GitHub 现在竟然需要将更多人力资源调配到确保可用性方面,在以前可用性方面通常不需要特别大的团队,但在现在的 GitHub,稳定性已经成为最大问题之一,所以 GitHub 不得不将更多团队和资源重新分配到可用性方面。
这个团队将加大测试、提高安全部署能力、推出更好的可观测行机制以及构建更有效的告警机制,也就是从方方面面提高 GitHub 的整体可用性。费多罗夫称现在在可用性方面已经取得进展,但工作尚未完成,所以还需要更多时间。
消息源:GitHub Blog





