Vào rạng sáng ngày 27 tháng 8 năm 2026, Proton đã gặp phải một sự cố gián đoạn trên diện rộng, ảnh hưởng đến dịch vụ của một số người dùng. Nguyên nhân gốc rễ là do hệ thống làm mát tại trung tâm dữ liệu Frankfurt của chúng tôi bị hỏng hoàn toàn. Mặc dù tất cả các hệ thống tại Proton đều có tính năng dự phòng và chúng tôi có đủ dung lượng để chịu được sự cố hỏng hóc hoàn toàn của một trung tâm dữ liệu, nhưng vẫn có một số ít trường hợp mà việc chuyển đổi dự phòng có thể mất nhiều thời gian hơn và dẫn đến gián đoạn ảnh hưởng tới người dùng.

Dưới đây là dòng thời gian về những gì đã diễn ra, các quyết định chúng tôi đã đưa ra trong sự cố và lý do tại sao, cũng như cách sự cố được giải quyết.

Dòng thời gian

Ngay sau 23:00 (giờ Trung Âu) vào Thứ Tư, ngày 26 tháng 8, hệ thống làm mát tại phòng máy chính của trung tâm dữ liệu Frankfurt đã gặp sự cố. Vào khoảng 23:15, nhiệt độ bắt đầu tăng từ khoảng 21,8°C (nhiệt độ tiêu chuẩn) lên 51,9°C chỉ trong vòng chưa đầy nửa giờ, với một số đầu đo ghi nhận nhiệt độ không khí trong phòng lên tới 60°C. Khi nhiệt độ tăng cao, các máy chủ và thiết bị mạng bên trong cơ sở bắt đầu ngừng hoạt động từng thiết bị một.

Sự cố ảnh hưởng đến người dùng bắt đầu vào khoảng nửa đêm ngày 27 tháng 8, khi các hỏng hóc leo thang đến mức mất đi khả năng dự phòng quan trọng. Điều này xảy ra khi cả thiết bị chuyển mạch mạng chính và dự phòng trên một tủ rack quan trọng đều bị hỏng, và tủ rack này không may lại chứa một số bản sao cơ sở dữ liệu chính. Mặc dù hầu hết mọi hệ thống của Proton đều có tính năng dự phòng và sẽ tự động/ngay lập tức chuyển đổi dự phòng, nhưng việc chuyển đổi dự phòng cơ sở dữ liệu chính lại không được thực hiện tự động nếu không có sự giám sát của con người.

Chúng tôi duy trì quyền kiểm soát này nhằm tránh các tình huống được gọi là “phân chia não bộ” (split-brain), khi sự gián đoạn tạm thời của cơ sở dữ liệu chính khiến các bản sao bỏ lỡ một số cập nhật và bị mất đồng bộ theo cách khó có thể đối soát lại sau đó. Hơn nữa, khi việc chuyển đổi dự phòng cơ sở dữ liệu chính diễn ra, quy trình vận hành tiêu chuẩn là chuyển đổi sang một bản sao trong cùng trung tâm dữ liệu vì lý do độ trễ và hiệu năng. Tuy nhiên, tính chất cụ thể của sự cố lần này cho thấy hành động đó có thể là không khôn ngoan, vì chúng tôi có khả năng chuyển đổi sang một hệ thống cũng sắp bị sập.

Các quyết định

Tại thời điểm này, các kỹ sư trực ca của Proton cần phải đưa ra một vài quyết định hệ trọng trong khi chịu áp lực vô cùng lớn.

  • Nên ưu tiên đưa dịch vụ trực tuyến trở lại, hay ưu tiên xử lý sự cố làm mát và bảo vệ phần cứng bên trong trung tâm dữ liệu?
  • Chúng tôi nên chuyển đổi dự phòng sang các bản sao trong cùng tòa nhà ở Frankfurt (nhanh hơn và ít gây gián đoạn hơn, nhưng có thể chỉ là giải pháp tạm thời nếu nhiệt độ không được kiểm soát), hay chuyển đổi dự phòng sang Zurich?
  • Chúng tôi nên chuyển đổi dự phòng toàn bộ hay chỉ những phần đang bị sập tại thời điểm đó? Chúng tôi có các phương án dự phòng cho trường hợp trung tâm dữ liệu gặp sự cố hoàn toàn, khi đó mọi thứ sẽ chuyển đổi dự phòng đầy đủ và phần lớn là tự động tương đối nhanh chóng, nhưng tình huống các máy chủ ngẫu nhiên lần lượt ngừng hoạt động lại chưa được logic chuyển đổi dự phòng của chúng tôi xử lý tốt.

Cuối cùng, tốc độ tăng nhiệt độ đã buộc chúng tôi phải ưu tiên bảo vệ phần cứng thay vì đưa các dịch vụ trực tuyến trở lại. Đây thường không phải là một lựa chọn bắt buộc phải đưa ra, vì các hệ thống làm mát thường có cơ chế dự phòng và việc mất hoàn toàn khả năng làm mát là rất hiếm, nghĩa là có khá nhiều thời gian trước khi nhiệt độ đạt mức nguy kịch. Vấn đề này càng trầm trọng hơn do mật độ năng lượng máy chủ tăng mạnh trong những năm gần đây với các CPU và GPU công suất cao hơn dành cho AI. Kết quả là, những gì trước đây phải mất 3-4 giờ mới đạt mức nguy kịch thì nay đã tới ngưỡng nguy kịch chỉ trong 20 phút.

Do đó, đội ngũ trực ca đã tập trung vào việc liên lạc với đội ngũ vận hành trung tâm dữ liệu tại chỗ để khôi phục hệ thống làm mát, đồng thời tắt nguồn càng nhiều máy chủ càng tốt để bảo vệ chúng. Do tình trạng khan hiếm thiết bị máy chủ liên quan đến sự bùng nổ AI hiện nay, nhiều thiết bị trong số này — nếu bị hỏng — sẽ không thể thay thế trong thời gian ngắn. Việc cứu các thiết bị này phải là ưu tiên hàng đầu, ngay cả khi phải chấp nhận nguy cơ kéo dài thời gian ngừng hoạt động.

Đến 00:45 CEST, chúng tôi đã có thể khôi phục hệ thống làm mát và nhiệt độ tại cơ sở bắt đầu giảm, đội ngũ trực ca chuyển trọng tâm sang việc khôi phục dịch vụ. Tại thời điểm này, chúng tôi đã quyết định chuyển đổi dự phòng các cơ sở dữ liệu chính sang Frankfurt nếu bản sao vẫn còn hoạt động, và sang Zurich trong trường hợp không còn bản sao nào hoạt động ở Frankfurt, nhằm tránh thay đổi luồng lưu lượng truy cập quá nhiều và có nguy cơ gây ra sự bất ổn mới. Tùy chọn này được chọn vì chúng tôi giả định rằng, khi hệ thống làm mát đã được kiểm soát, việc đưa Frankfurt trực tuyến trở lại sẽ tương đối dễ dàng và nhanh hơn so với chuyển sang Zurich.

Thật không may, thực tế lại không diễn ra như vậy. Trong sự cố, nhiều card mạng trong cơ sở hạ tầng ở Frankfurt đã đạt mức nhiệt độ 105°C (nhiệt độ hoạt động bình thường là 45°C), kích hoạt chế độ bảo vệ nhiệt độ đặc biệt và khiến các card mạng bị vô hiệu hóa cho đến khi hệ thống được đặt lại hoàn toàn (cold reset). Chính sách bảo mật của chúng tôi hạn chế quyền truy cập vào bộ điều khiển ngoài băng thông (out-of-band controller) của hệ thống, đòi hỏi chúng tôi phải đánh thức thêm nhân viên để hỗ trợ khôi phục.

Đến 01:30 CEST, chúng tôi đã có thể đưa hầu hết các dịch vụ trực tuyến trở lại cho phần lớn người dùng. Tuy nhiên, một số hệ thống ít quan trọng hơn, chẳng hạn như thông báo đẩy hoặc xử lý thanh toán, mãi đến khoảng 02:00 CEST mới được khôi phục.

Như chúng tôi đã thông báo trong báo cáo sự cố ban đầu, không có email nào bị mất, nhưng việc gửi và nhận email theo cả hai chiều đã bị chậm trễ trong thời gian diễn ra sự cố.

Mặc dù các dịch vụ dành cho người dùng đã được khôi phục hoàn toàn, nhưng đêm làm việc của các kỹ sư chúng tôi vẫn chưa kết thúc, đặc biệt là đội ngũ phụ trách cơ sở dữ liệu. Cơ sở hạ tầng của chúng tôi rơi vào trạng thái hết sức bất thường, với một số cơ sở dữ liệu chính đặt tại Zurich và một số khác ở Frankfurt, cùng vài cơ sở dữ liệu trong số đó hoạt động với khả năng dự phòng và/hoặc hiệu năng bị suy giảm. Đội ngũ của chúng tôi đã làm việc xuyên đêm để giải quyết những sự cố cấp bách nhất này, và công việc vẫn tiếp tục trong suốt ngày 27 tháng 8 nhằm khôi phục hoàn toàn khả năng dự phòng.

Dù chúng tôi đã cứu được gần như toàn bộ cơ sở hạ tầng, nhưng một số máy chủ không may đã bị hỏng do nhiệt độ quá cao, và chúng tôi vẫn chưa rõ liệu sự cố tăng nhiệt này có ảnh hưởng đến tuổi thọ của các thiết bị còn lại hay không.

Nguyên nhân gốc rễ và các bước tiếp theo

Một cuộc điều tra tiếp theo vào ngày 27 tháng 8 đã xác định nguyên nhân gốc rễ của sự cố làm mát là do việc thay thế bộ lọc không khí trên cả hai máy nén khí dự phòng cung cấp năng lượng cho hệ thống làm mát. Đáng tiếc là đơn vị vận hành trung tâm dữ liệu đã thực hiện thao tác này vào giữa đêm mà không thông báo trước, đồng thời cũng không thông báo về sự cố làm mát khi nó xảy ra, khiến thời gian phản ứng của chúng tôi bị giảm đi đáng kể. Chúng tôi đang làm việc chặt chẽ với đơn vị vận hành để ngăn chặn sự cố này tái diễn.

Tuy nhiên, đây cũng là một hạn chế đã biết trong cơ sở hạ tầng cơ sở dữ liệu hiện tại của chúng tôi khi một sự cố gián đoạn thuộc loại này có thể dẫn đến quy trình khôi phục kéo dài hơn bình thường. Chuỗi sự kiện dẫn đến sự cố này là điều cực kỳ khó xảy ra — nhưng chúng vẫn xảy ra.

Công việc nâng cao khả năng phục hồi của cơ sở dữ liệu cần thiết để giải quyết dạng sự cố này đã được tiến hành và dự kiến hoàn thành vào cuối năm. Dung lượng cơ sở hạ tầng bổ sung, bao gồm cả không gian trung tâm dữ liệu mới, hiện cũng đang được triển khai và dự kiến sẽ sẵn sàng trong vài tuần tới, giúp giảm thêm sự phụ thuộc của chúng tôi vào một địa điểm duy nhất.

Thật không may, sự cố này xảy ra trước khi những cải tiến đó được triển khai hoàn chỉnh. Hiện chúng tôi đang xem xét những phần việc có thể đẩy nhanh một cách an toàn mà vẫn duy trì được mức độ cẩn trọng cần thiết đối với các thay đổi trong cơ sở hạ tầng cơ sở dữ liệu quan trọng.

Chúng tôi hiểu rằng người dùng luôn kỳ vọng mức độ tin cậy rất cao từ Proton, và sự cố này càng nhấn mạnh tầm quan trọng của việc hoàn thành công việc này cũng như tiếp tục nâng cao các tiêu chuẩn phục hồi của chúng tôi. Chúng tôi một lần nữa thành thật xin lỗi mọi người dùng đã bị ảnh hưởng.