Kavramın hikâyesi
Önce iş karşılığını gör, gerektiğinde bağlamı aç.
İlk taramaİşte karşılaşacağın sinyaller
Gerilim ve çözüm · Bölüm 01
Hangi problemi çözer?
Incident çerçevesi “şu anda kullanıcıya etkisi ne, kim koordine ediyor, hangi değişiklik denendi ve ne sonuç verdi?” sorularını ortaklaştırır.
Tam bağlamı açGerekçe, sınırlar ve kalan ayrıntı
Teknik çalışma ile iletişimi ayırabilir, çakışan production değişikliklerini sınırlar ve mitigation'a odaklanmayı kolaylaştırır. Çerçeve tek başına kök nedeni bulmaz; ekip çalışmasının kontrolsüz dağılmasını azaltır.
Gerçek hayat · Bölüm 02
Gerçek iş senaryosu
SCN-005'te release sonrasında checkout isteklerinin bir kısmı hata verir. Junior alert'i görür, etkilenen zaman aralığını ve son deployment'ı kontrol eder.
Tam bağlamı açGerekçe, sınırlar ve kalan ayrıntı
Kendi başına art arda production değişikliği yapmak yerine ekibin incident ilan eşiğine göre escalation yapar; bilinen etkiyi, denenen Rollback/Feature Flag adımını ve gözlenen sonucu ortak kayda ekler. Hizmet toparlandıktan sonra açık takip işleri ve Postmortem sahibi belirlenir.
Duyacağın bağlam · Bölüm 03
Ekipte bunu nasıl duyabilirsin?
Temsili ekip konuşması: “Checkout hatası kullanıcıların bir bölümünü etkiliyor ve SEV eşiğimizi karşılıyor. Incident kaydını açıyorum; production değişikliklerini Ops rolüyle koordine edip doğrulanmış etkileri Comms notuna geçelim.”
Beklenti seviyesi · Bölüm 04
Junior hangi seviyede bilmeli?
- Tanı: Alert, Incident, impact, severity, mitigation, escalation, Incident Commander/Ops/Comms ve resolution terimlerini bağlam içinde ayırt edebilmelisin.
- Açıkla: Incident yönetiminin yalnız debug değil, koordinasyon ve iletişim problemi de çözdüğünü; her şirketin aynı SEV tablosunu kullanmadığını anlatabilmelisin.
- Uygula: Etki ve kanıtı kısa biçimde aktarmalı, tanımlı escalation yolunu kullanmalı, ortak kaydı güncel tutmalı ve yetki/rol dışında production değişikliği yapmamalısın.
- Şimdilik bilmesi gerekmeyen: Büyük incident'ı tek başına komuta etmek, kurumsal severity modeli tasarlamak, hukuki bildirim kararı vermek ve güvenlik adli incelemesi yürütmek.
İhtiyacın kökeni · Bölüm 05
Neden ortaya çıktı?
Production sorunu büyürken birçok kişi aynı anda teknik değişiklik yapar, farklı varsayımlarla debug eder ve paydaşlar ayrı kanallardan bilgi isterse asıl etkiyi azaltmak zorlaşır.
Tam bağlamı açGerekçe, sınırlar ve kalan ayrıntı
Incident yönetimi teknik çözümün yanına ortak durum, roller, iletişim ve karar kaydı ekleyerek bu eşzamanlı işi düzenlemek için kullanılır.
Ekip etkisi · Bölüm 06
Şirketler neden kullanır?
Ekipler etki belirli bir eşiği aştığında normal ticket akışından daha hızlı ve görünür bir yanıt başlatmak için Incident ilanı ve severity seviyeleri kullanabilir.
Tam bağlamı açGerekçe, sınırlar ve kalan ayrıntı
Google'ın Incident Command System türevi rolleri ile Atlassian'ın SEV tanımları iki somut uygulamadır. Rol adları, ilan eşiği, dış iletişim ve çalışma kanalı her organizasyonda aynı değildir; önemli olan tanımın olaydan önce anlaşılır olmasıdır.
Karar alanı · Bölüm 07
Trade-off ve bağlam
Erken Incident ilanı koordinasyonu hızlandırabilir; çok düşük eşik ise gereksiz kesinti ve alarm yorgunluğu yaratabilir.
Tam bağlamı açGerekçe, sınırlar ve kalan ayrıntı
Geç ilan ise etki büyürken dağınık müdahaleye yol açabilir. Küçük olayda roller aynı kişide birleşebilir, büyük olayda ayrılabilir. Severity ilk bilgiyle tahmin edilir ve etki değiştikçe güncellenebilir; seviye tartışması mitigation'ı geciktirmemelidir.
Yanılgı radarı · Bölüm 08
Yaygın yanlış anlamalar
- “Incident yalnızca bütün sistemin çökmesidir.” Yanlış; kısmi işlev veya kalite kaybı da ekip eşiğini aşabilir.
- “Her kırmızı alert Incident'tır.” Yanlış; alert incelenmesi gereken bir sinyaldir.
- “SEV-1 her şirkette aynı demektir.” Yanlış; numara, eşik ve yanıt modeli organizasyona özgüdür.
- “Incident'ta herkes hızlıca production'da bir şey denemelidir.” Yanlış; koordinesiz değişiklikler durumu kötüleştirebilir ve kanıtı karıştırır.
- “Incident çözülünce bütün kalıcı işler bitmiştir.” Yanlış; resolution kullanıcı etkisinin sona ermesidir, takip ve öğrenme devam edebilir.
- “Incident yönetimi kök nedeni anında bulmak demektir.” Eksik; ilk hedef çoğu zaman etkiyi azaltmak ve hizmeti güvenle geri getirmektir.
Gerilim ve çözüm1. bölüm