# 운영 관측과 모니터링

[원문](https://www.linkymeadow.com/w/2cb803/)

마지막 수정: 2026-10-05 21:30 (KST)

서비스에서 무슨 일이 일어나는지 살펴보기 위한 로그·메트릭·트레이스와 수집 도구를 모았습니다. 애플리케이션의 상태를 계측하는 방법부터 장애를 알리는 기준과 신뢰성 목표까지 연결합니다.

## 관측 데이터의 종류

- [Signals — OpenTelemetry](https://opentelemetry.io/docs/concepts/signals/)

  트레이스·메트릭·로그 등 관측 신호의 역할과 관련 개념을 설명합니다.
- [Monitoring Distributed Systems — Google SRE](https://sre.google/sre-book/monitoring-distributed-systems/)

  지연·트래픽·오류·포화라는 주요 신호와 외부·내부 관측, 알림 설계의 기준을 설명합니다.
- [Metric types — Prometheus](https://prometheus.io/docs/concepts/metric_types/)

  Counter·Gauge·Histogram·Summary의 의미와 사용하는 상황을 설명합니다.

## 애플리케이션 계측

- [Language APIs and SDKs — OpenTelemetry](https://opentelemetry.io/docs/languages/)

  JavaScript·Java·Python 등 언어별 API·SDK와 각 신호의 지원 상태를 확인할 수 있습니다.
- [Concepts — Micrometer](https://docs.micrometer.io/micrometer/reference/concepts.html)

  MeterRegistry·Counter·Timer·Gauge 등 JVM 애플리케이션 계측의 구성 요소를 설명합니다.
- [High Cardinality Tags Detector — Micrometer](https://docs.micrometer.io/micrometer/reference/concepts/high-cardinality-tags-detector.html)

  태그 값의 종류가 늘어날 때 생기는 시계열·메모리 증가와 이를 탐지하는 방법을 설명합니다.

## 신뢰성 목표와 알림

- [Implementing SLOs — Google SRE Workbook](https://sre.google/workbook/implementing-slos/)

  사용자 관점의 서비스 수준 지표와 목표를 정하고 오류 예산으로 신뢰성을 관리하는 방법을 설명합니다.

## 관련 문서

- [보안 로그와 탐지](https://www.linkymeadow.com/w/1b71e1/)
- [방문 분석·오류 모니터링](https://www.linkymeadow.com/w/3adf41/)
- [분산 시스템과 운영](https://www.linkymeadow.com/w/913d6a/)
- [소프트웨어 테스트](https://www.linkymeadow.com/w/ac7642/)
- [백엔드 개발 학습 자료](https://www.linkymeadow.com/w/e48b27/)
