Senior mülakat senaryosuIncident müdahalesi

Bir Milyon Kullanıcı Sisteme Geldi ve Sistem Çöktü — Ne Yaparsın?

Mitigation, darboğaz izolasyonu, graceful degradation, cache, rate limiting, queue ve olay sonrası önleme adımlarını kapsayan production incident mülakat senaryosu.

Mülakat sorusu

Ani trafik artışı ürünü çökertiyor. İlk dakikaları, ihtiyaç duyduğun kanıtları, seçeceğin mitigation adımlarını ve recovery sonrasını anlat.

İlk güçlü çıkarım

İlk hedef kusursuz mimari değil, incident'ı büyütmeden en önemli kullanıcı akışını geri getirmektir. Stabilize et, gözlemle, izole et, mitigate et; kalıcı çözüme sonra geç.

Önce hangi sinyallere bakılır?

  • Endpoint bazında request rate, hata ve latency.
  • App, database, connection pool, queue ve bağımlılıklardaki saturation.
  • Son deployment'lar, feature flag'ler ve trafik kaynağı değişiklikleri.
  • Retry'ların veya pahalı tek bir endpoint'in yükü büyütüp büyütmediği.

Adım adım güçlü yaklaşım

1

Incident'ı ilan et ve koordine ol

Incident kanalı aç, incident commander ata, ilgisiz deploy'ları dondur ve ortak timeline tut. Net sahiplik, paralel çözümlerin recovery'yi zorlaştırmasını önler.

2

Sistemi koru

Kötüye kullanılan veya kritik olmayan trafiği rate limit et, pahalı özellikleri kapat, güvenliyse stale veri sun ve tamamlanamayacak işi reddet. Önce ana kullanıcı akışını koru.

3

Doyan bağımlılığı bul

App CPU, DB lock, connection tükenmesi, cache miss, queue backlog ve üçüncü taraf hatasını servis seviyesinde ayır. Yanlış katmanı büyütmek downstream baskısını artırabilir.

4

Geri alınabilir mitigation uygula

Kısıtlı stateless katmanı scale et, cache'i ısıt/genişlet, retry storm'u azalt, consumer'ları duraklat veya trafiği yönlendir. Kolay geri alınabilen ve hipotezi ölçülebilen değişiklikleri seç.

5

Kontrollü recovery yap

Özellikleri ve trafiği kademeli geri açarken error budget, queue age, database sağlığı ve cache hit oranını izle. Homepage'in açılması tek başına recovery değildir.

6

Tekrarını önle

Katkı sağlayan faktörleri, eksik alarmları, kapasite varsayımlarını ve load test, autoscaling, backpressure, runbook gibi sahipli aksiyonları içeren blameless inceleme yaz.

Cevabını bu sırayla yapılandır

  1. 01Kullanıcı etkisini ve incident hedefini belirt
  2. 02Koordine ol ve ek değişiklikleri durdur
  3. 03Telemetry ile saturation noktasını izole et
  4. 04Geri alınabilir mitigation seç
  5. 05Recovery'yi doğrula ve önleyici aksiyon çıkar

Zayıf cevap işaretleri

  • ×Kısıtlı katmanı bulmadan yalnızca 'daha fazla sunucu ekle' demek.
  • ×Retry'ların sağlıksız bağımlılıktaki baskıyı katlamasına izin vermek.
  • ×Timeline veya hipotez olmadan birden fazla geri döndürülemez değişiklik yapmak.

Takip soruları

  • ?Önce hangi özelliği kapatırsın?
  • ?App değil database doygunsa ne yaparsın?
  • ?Recovery sırasında retry storm'u nasıl engellersin?

Kısa FAQ

Bu soruda görüşmeci neyi ölçüyor?

Görüşmeci tek bir teknoloji adı değil; belirsizlik altında kanıt toplama, riski sınırlama, güvenli aksiyon seçme ve sonucu ölçme biçimini değerlendirir.

Cevap ne kadar uzun olmalı?

İlk iki dakikada hipotezini ve önceliğini belirt; ardından sinyal, teşhis, mitigation ve doğrulama sırasıyla ilerle. Ayrıntıyı görüşmecinin takip sorularına göre derinleştir.