서비스 초기에 먼저 확인할 모니터링 지표
많은 대시보드보다 장애를 빠르게 감지할 수 있는 기본 지표부터 골랐습니다.
모니터링 도구를 도입하면 수십 개의 지표를 한 번에 수집할 수 있습니다. 하지만 모든 그래프를 계속 보는 것은 어렵기 때문에 사용자 영향과 직접 연결되는 항목부터 선택했습니다.
기본 지표
- 요청 수와 상태 코드 비율
- 응답 시간의 평균 및 상위 백분위
- 애플리케이션 오류 수
- 데이터베이스 연결 풀 사용량
- CPU와 메모리 사용량
평균 응답 시간만 보면 일부 사용자가 겪는 긴 지연을 놓칠 수 있습니다. 그래서 p95, p99 값과 함께 확인했습니다.
알림은 많이 받는 것보다 실제로 행동할 수 있는 조건으로 설정하는 것이 중요합니다.
초기에는 복잡한 예측보다 명확한 임계값을 사용하고, 운영 데이터를 쌓은 뒤 시간대와 트래픽 패턴에 맞게 조정할 계획입니다.
