모든 글

서비스 초기에 먼저 확인할 모니터링 지표

많은 대시보드보다 장애를 빠르게 감지할 수 있는 기본 지표부터 골랐습니다.

모니터링 도구를 도입하면 수십 개의 지표를 한 번에 수집할 수 있습니다. 하지만 모든 그래프를 계속 보는 것은 어렵기 때문에 사용자 영향과 직접 연결되는 항목부터 선택했습니다.

기본 지표

  • 요청 수와 상태 코드 비율
  • 응답 시간의 평균 및 상위 백분위
  • 애플리케이션 오류 수
  • 데이터베이스 연결 풀 사용량
  • CPU와 메모리 사용량

평균 응답 시간만 보면 일부 사용자가 겪는 긴 지연을 놓칠 수 있습니다. 그래서 p95, p99 값과 함께 확인했습니다.

알림은 많이 받는 것보다 실제로 행동할 수 있는 조건으로 설정하는 것이 중요합니다.

초기에는 복잡한 예측보다 명확한 임계값을 사용하고, 운영 데이터를 쌓은 뒤 시간대와 트래픽 패턴에 맞게 조정할 계획입니다.