서비스에서 무슨 일이 일어나는지 살펴보기 위한 로그·메트릭·트레이스와 수집 도구를 모았습니다. 애플리케이션의 상태를 계측하는 방법부터 장애를 알리는 기준과 신뢰성 목표까지 연결합니다.
관측 데이터의 종류
-
트레이스·메트릭·로그 등 관측 신호의 역할과 관련 개념을 설명합니다.
-
Monitoring Distributed Systems — Google SRE
지연·트래픽·오류·포화라는 주요 신호와 외부·내부 관측, 알림 설계의 기준을 설명합니다.
-
Counter·Gauge·Histogram·Summary의 의미와 사용하는 상황을 설명합니다.
애플리케이션 계측
-
Language APIs and SDKs — OpenTelemetry
JavaScript·Java·Python 등 언어별 API·SDK와 각 신호의 지원 상태를 확인할 수 있습니다.
-
MeterRegistry·Counter·Timer·Gauge 등 JVM 애플리케이션 계측의 구성 요소를 설명합니다.
-
High Cardinality Tags Detector — Micrometer
태그 값의 종류가 늘어날 때 생기는 시계열·메모리 증가와 이를 탐지하는 방법을 설명합니다.
신뢰성 목표와 알림
-
Implementing SLOs — Google SRE Workbook
사용자 관점의 서비스 수준 지표와 목표를 정하고 오류 예산으로 신뢰성을 관리하는 방법을 설명합니다.