İçeriğe atla
Observability Mühendisliği

Observability (Metrikler, Loglar, Trace'ler, APM)

Observability: metrikler, loglar ve trace'ler. Sistemin neden yavaşladığını gösteren üç sinyalin birlikte kurulması ve hizmet seviyesi göstergelerine bağlanması.

Neler sunuyoruz

  1. Prometheus ve benzeri araçlarla altyapı ve uygulama metriklerinin toplanması; cardinality ve saklama süresi kararlarının baştan verilmesi.

  2. Bir isteğin servisler arasındaki yolculuğunun izlenmesi; gecikmenin hangi çağrıda oluştuğunun tahminle değil ölçümle bulunması.

  3. Grafana dashboard'larının soruya göre tasarlanması. Her metriği gösteren dashboard, hiçbir soruyu cevaplamayan dashboard'dır.

  4. Kullanıcının gerçekten hissettiği şeyin ölçülmesi: yanıt süresi, hata oranı, erişilebilirlik. Sunucu ayakta olabilir ve servis çalışmıyor olabilir.

  5. Uyarıların belirti yerine etkiye bağlanması; gece yarısı uyandıran her uyarının gerçekten aksiyon gerektirmesi.

  6. Normal davranışın ölçülmesi ve sapmaların bu çizgiye göre değerlendirilmesi; sürüm sonrası bozulmaların erken görülmesi.

7/24İzleme
%99,99Uptime
İşletim mimarisi

Nasıl çalışıyor

Her iş aynı beş adımdan geçer: mevcut durumu çıkarırız, hedef modeli tasarlarız, kademeli devreye alırız, işletiriz ve ölçüme göre iyileştiririz.

01

Tespit

Mevcut durumu çıkarır, açıkları ve başarı ölçütlerini yazılı hale getiririz.

02

Tasarım

Hedef işletim modelini ve gereken araç zincirini kurgularız.

03

Devreye alma

Kademeli olarak kurar, yapılandırır ve doğrularız.

04

İşletim

7/24 yönetim; sözleşmeli müdahale süreleri ve önleyici izleme.

05

İyileştirme

Metrikler, olaylar ve iş ihtiyacındaki değişime göre sürekli iyileştirme.

Sözleşmeli servis seviyesi

Her iş, yazılı SLA ile yürür; iyi niyet beyanı değil, taahhüt.

Mühendis yürütür

Sizin stack'inizi bilen adanmış mühendisler. Genel amaçlı bir çağrı merkezi katmanı yok.

Sürekli iyileştirme

İki haftada bir servis değerlendirmesi, üç ayda bir yol haritası güncellemesi.

Kimler kullanıyor

Observability (Metrikler, Loglar, Trace'ler, APM) hizmetini birlikte yürüttüğümüz sektörler.

Bu hizmette kullandığımız teknolojiler

ÜRETİMDEDENENİYORİNCELENİYORUZAK DURULUYORGrafana
Aşağıdaki teknolojiler, Eclit teknoloji radarından alınmıştır. Bir teknolojinin hangi radar halkasında yer aldığı, o teknolojinin ne kadar iyi olduğunu değil, bizim onu kendi operasyonumuzda hangi olgunlukta kullandığımızı anlatır.
Teknoloji radarının tamamı →

Bu hizmetin kavramları

Monitoring (izleme)
Sistem, ağ ve uygulamaların sürekli gözlenmesi.
Sürekli izleme
Sistemlerin kesintisiz gözlenmesi ve eşik aşımlarında otomatik uyarı üretilmesi.
Time To First Byte (TTFB)
Bir isteğin gönderilmesinden ilk baytın alınmasına kadar geçen süre.

Bu sayfada geçen teknik terimlerin ne anlama geldiğini burada bulabilirsiniz. Tanımlar Eclit'in kendi teknoloji sözlüğünden alınmıştır; her terim, sözlükteki tam açıklamasına bağlanır.

Teknoloji sözlüğünün tamamı →
01Observability ile izleme arasındaki fark ne?

İzleme, bildiğiniz soruların cevabını veriyor: sunucu ayakta mı, disk dolu mu. Observability, sormadığınız soruları sorabilmenizi sağlıyor: bu istek neden yavaştı, hangi kullanıcı grubunu etkiledi. Fark, önceden tanımlanmamış bir sorunu inceleyebilmekte.

02Metrik, log ve iz; üçü de gerekli mi?

Üçü farklı soruya cevap veriyor. Metrik ne kadar, log ne oldu, iz nerede geçti. Yalnızca log toplayan bir kurum, yavaşlığın hangi serviste başladığını göremiyor; yalnızca metrik toplayan neden olduğunu göremiyor.

03Uygulama koduna dokunmak gerekiyor mu?

Çoğu dilde otomatik enstrümantasyon ajanla çalışıyor, koda dokunmadan. Özel iş metrikleri (sepet tutarı, işlem tipi) için kodda birkaç satır gerekiyor; bu satırlar en değerli veriyi üretiyor.

04Veri hacmi maliyeti çok artırır mı?

Örnekleme ve saklama katmanları ile kontrol ediliyor. Her isteğin izini tam olarak saklamak gerekmiyor; hatalı ve yavaş istekler tam, geri kalanı örneklenerek tutuluyor. Yapılandırma yapılmazsa maliyet gerçekten hızla büyüyor.

05Sorun anında ne kadar hızlı kök nedene ulaşılıyor?

Dağıtık iz varsa dakikalar. Olmadığında aynı analiz, servisten servise log karşılaştırmasıyla saatler sürüyor. Gözlemlenebilirliğin somut getirisi bu sürenin kısalması.

Nereden başlayacağınızı birlikte çıkaralım

İki hafta içinde neyin çalıştığını, neyin risk taşıdığını ve önceliklendirilmiş bir yol haritasını yazılı veriyoruz.

Görüşme talep edin