在 2026 年 8 月 27 日凌晨,Proton 發生了大範圍的服務中斷,影響了許多使用者的服務。根本原因在於我們法蘭克福資料中心的冷卻系統全面故障。雖然 Proton 的所有系統都具備備援機制,且擁有足夠的容量來承受整個資料中心故障,但在少數情況下,容錯移轉可能需要更長時間,並導致面向使用者的服務中斷。
以下是事件發生的時間軸、我們在事件期間所做的抉擇與原因,以及問題最終如何獲得解決。
時間軸
8 月 26 日星期三晚上 11 點剛過(中歐時間),我們法蘭克福資料中心的主機房發生了冷卻系統故障。大約在晚上 11:15,溫度在不到半小時內從大約 21.8°C(正常溫度)飆升至 51.9°C,部分測量探針回報機房內的氣溫甚至達到 60°C。隨著溫度上升,設施內的伺服器和網路設備開始逐一停擺。
面向使用者的事件始於 8 月 27 日午夜左右,當時故障情況擴大,導致關鍵備援機制失效。這是因為某個關鍵機架上的主要與備份網路交換器皆發生故障,而不幸的是,該機架包含數個主要資料庫複本。雖然幾乎所有的 Proton 系統都具備備援機制且會自動/即時進行容錯移轉,但主要資料庫的容錯移轉在沒有人工監督的情況下是不會自動執行的。
我們保留這項人工作業控制,是為了避免所謂的「裂腦」(split-brain)狀況,即主要資料庫的暫時無法使用會導致複本遺漏某些更新,並造成難以在事後協調的一致性問題。此外,當主要資料庫發生容錯移轉時,標準作業程序是基於延遲和效能考量,容錯移轉至同一資料中心內的複本。然而,這次問題的特殊性質意味著這樣做可能並不明智,因為我們可能會容錯移轉到即將停擺的設備上。
重大決策
此時,Proton 的值班工程師需要在極大壓力下做出幾項重大決定。
- 他們應該優先讓服務恢復線上運作,還是優先解決冷卻問題並搶救資料中心內的硬體?
- 我們應該容錯移轉到法蘭克福同棟建築內的複本(速度更快且中斷更少,但若無法控制高溫,可能只是權宜之計),還是容錯移轉到蘇黎世?
- 我們應該容錯移轉所有項目,還是僅容錯移轉目前當機的部分?我們針對整個資料中心故障制定了應急計畫,可快速且大多自動地完全容錯移轉,但隨機伺服器逐一停擺的狀況並無法被我們的容錯移轉邏輯妥善處理。
最終,溫度上升的速度迫使我們將保護硬體置於讓服務恢復線上運作之前。這通常不是需要做出的抉擇,因為冷卻系統通常具備備援機制,且冷卻功能完全喪失的情況極為罕見,這意味著在溫度達到臨界點之前通常有相當充裕的時間。近年來由於採用功耗更高的 AI CPU 和 GPU,伺服器功率密度大幅增加,使這個問題更加嚴峻。因此,過去需要 3 到 4 小時才會達到臨界溫度的情況,如今在 20 分鐘內就達到了臨界狀態。
因此,值班團隊將注意力集中在與現場資料中心營運團隊溝通以還原冷卻系統,同時關閉盡可能多的伺服器以保護硬體。由於當前 AI 熱潮導致伺服器設備短缺,這些設備一旦損壞,很難在短時間內替換。搶救硬體必須是首要任務,即使這可能意味著延長停機時間。
到了 中歐夏令時間 00:45,我們成功還原了冷卻系統,設施內的溫度開始下降,值班團隊隨即將焦點轉向服務復原。此時,我們決定若法蘭克福仍有正常運作的複本,就將主要資料庫容錯移轉至法蘭克福;若法蘭克福沒有正常運作的複本,則容錯移轉至蘇黎世,以避免過度改變流量路線並可能引發新的不穩定情況。選取這個選項是因為我們預期既然冷卻問題已受到控制,讓法蘭克福恢復線上運作相對容易,且比切換至蘇黎世更快。
不幸的是,事實並非如此。在事件期間,法蘭克福基礎架構中的許多網路卡溫度達到了 105°C(正常運作溫度為 45°C),這觸發了特殊的溫度保護模式,導致網路卡被停用,直到系統執行冷重設為止。我們的安全機制限制了存取系統頻外控制器的權限,這需要我們叫醒其他同仁來協助進行復原。
到了 中歐夏令時間 01:30,我們已為大多數使用者將多數服務恢復線上運作。然而,某些較不關鍵的系統(例如推播通知或付款處理)直到中歐夏令時間 02:00 左右才復原完成。
正如我們在初步事件報告中所說,沒有任何電子郵件遺失,但在事件期間雙向的電子郵件遞送皆有所延遲。
雖然面向使用者的服務已完全還原,但對我們的工程師(特別是資料庫團隊)來說,這並不是當晚工作的結束。我們的基礎架構處於高度異常的狀態,部分主要資料庫位於蘇黎世,其他則位於法蘭克福,其中有幾個是在備援能力降低及/或效能降低的情況下運作。我們的團隊徹夜工作以解決這些最急迫的問題,並在 8 月 27 日持續進行工作以還原完整的備援能力。
雖然我們搶救了幾乎所有的基礎架構,但不幸的是有些伺服器遭遇了過熱損壞,我們目前尚無法確定這次高溫事件是否會影響存活設備的使用壽命。
根本原因與後續措施
8 月 27 日進行的後續調查將冷卻故障的根本原因追溯至為冷卻系統供電的兩台備援空氣壓縮機上的空氣濾清器更換作業。不幸的是,資料中心業者在未事先通知的情況下於半夜執行了此項作業,且在冷卻故障發生時也未能及時通知,這大幅縮短了我們能夠應變的時間。我們正與業者密切合作,以防止此類事件再次發生。
然而,這種類型的服務中斷可能導致比平常更長的復原流程,這也是我們目前資料庫基礎架構已知的限制。導致這次事件的一連串事件發生機率極低——但它們確實發生了。
解決此故障模式所需的資料庫韌性工作已經在進行中,並按規劃於年底前完成。額外的基礎架構容量(包括新的資料中心空間)目前也正在進行驗收啟用,預計在未來幾週內上線,這將進一步降低我們對單一地點的依賴。
遺憾的是,在這些改善措施完全就緒之前發生了這次事件。我們目前正在評估如何在保持關鍵資料庫基礎架構變更所需謹慎程度的同時,安全地加速完成剩餘的工作。
我們深知使用者對 Proton 的可靠性有著極高的期待,而這次事件更加強了完成這些工作以及持續提高韌性標準的重要性。我們再次向每一位受到影響的使用者致上誠摯的歉意。






