Skip to content

서버 감시 ​

서버 감시에서 포트·웹 응답·리소스 사용량 등을 주기적으로 검사하고, 기준을 넘으면 장애로 판단해 알립니다.

감시 추가하기 ​

  1. + 감시 추가를 누르고 감시 종류를 고릅니다.
  2. 그 종류에 필요한 입력만 나오고 권장 기본값이 채워져 있습니다. 대상 서버와 임계값을 확인합니다.
  3. 저장합니다. 다른 종류로 바꾸려면 종류 변경을 누릅니다.

감시 종류 ​

분류종류
접속·서비스 응답TCP 포트, HTTP 응답, OS 서비스
CPU·메모리·디스크CPU 사용률, CPU I/O 대기, 부하 평균, 메모리·스왑·시스템 디스크 사용률, GPU 사용률, GPU 메모리 사용률, 디스크 I/O 처리량
프로세스프로세스 실행 여부, 프로세스 CPU 사용률, 프로세스 메모리 사용량
네트워크·연결네트워크 트래픽, TCP 연결 수, 웹 연결 수, 포트별 TCP 연결 수, SYN 대기 연결 수, 단일 IP 최대 연결 수, TIME_WAIT 연결 수, UDP 수신 패킷, UDP 소켓 수
사이트 트래픽사이트 5xx 비율(%), 사이트 평균 응답 시간(ms)
데이터베이스DB 연결·상태

얼마나 지속되면 알리나요 ​

지표 감시는 연속 초과 횟수 × 주기 동안 임계값을 넘어야 장애로 판단합니다. 입력 창 아래에 "약 n분 지속되면 알립니다"로 계산해 보여 줍니다.

예: CPU 90% · 60초 주기 × 5회 = 약 5분 지속되면 알림

기본 프리셋으로 한 번에 추가 ​

기본 프리셋으로 추가는 서버 관리자가 먼저 챙기는 핵심 감시를 묶음으로 추가합니다.

프리셋포함 항목
단계별 경고·긴급같은 지표를 두 단계로: CPU 경고 (80%·10분)·긴급 (95%·5분), 메모리 경고 (85%)·긴급 (95%), 디스크 경고 (80%)·긴급 (95%)
필수 리소스CPU 지속 과부하, 메모리 부족, 시스템 디스크 가득 참, 스왑 과다, 디스크 I/O 대기, SSH 또는 원격 데스크톱 포트
웹 서버HTTPS 응답, HTTP 포트, 웹 연결 급증, 트래픽 대량 발생
공격·이상 연결SYN 플러드, 단일 IP 연결 집중, UDP 플러드, TCP 연결 급증, TIME_WAIT 누적
DB 서버MySQL·MariaDB 포트, DB 포트 연결 폭주, 디스크 I/O 지속 높음, DB 디스크 대기
GPU 서버GPU 사용률 경고 (90%·10분)·긴급 (98%·30분), GPU 메모리 경고 (90%)·부족 (98%)
주요 프로세스Nginx·Apache·MySQL·MariaDB·PostgreSQL·Redis·PHP-FPM·SQL Server 중지, Java·Node.js·PHP-FPM·IIS 작업자 CPU·메모리 과다

같은 이름의 감시가 이미 있으면 이미 있음으로 빠지고, 운영체제와 맞지 않는 항목은 기본 선택에서 빠집니다. GPU가 없는 서버의 GPU 항목은 GPU 없음, 지금 실행 중이 아닌 프로세스 항목은 실행 중 아님으로 표시되며 기본 선택에서 빠집니다(직접 체크하면 추가할 수 있습니다). 추가한 뒤 서버 사양에 맞게 임계값을 조정하세요.

경고와 긴급 나누기 ​

감시마다 심각도를 정보·경고·긴급 중에서 고릅니다. 같은 지표에 감시를 두 개 만들면 단계를 나눌 수 있습니다. 예를 들어 "CPU 80% · 10분 → 경고"와 "CPU 95% · 5분 → 긴급"을 함께 두면, 경고에서 미리 대응하고 긴급은 바로 알림을 받습니다. 알림 규칙에서 심각도별로 받을 채널을 다르게 정할 수 있습니다.

프로세스·GPU 감시 ​

  • 프로세스 실행 여부: 프로세스 이름과 최소 실행 개수를 넣습니다. 실행 개수가 최소보다 적은 상태가 이어지면(프로세스가 멈추면) 알립니다.
  • 프로세스 CPU 사용률·프로세스 메모리 사용량: 같은 이름 프로세스들의 합계로 판단합니다. CPU는 서버 전체를 100%로 본 값이고, 메모리는 MB 단위입니다.
  • 프로세스 이름은 실행 파일 이름만 입력합니다(예: nginx, java, w3wp.exe). 대소문자와 .exe는 구분하지 않습니다. 입력란에서 지금 실행 중인 프로세스 이름을 고를 수 있습니다.
  • 프로세스 감시는 최신 에이전트가 필요합니다. 오래된 에이전트에서는 이 Agent는 프로세스 감시를 지원하지 않습니다 · Agent를 업데이트하세요가 표시됩니다.
  • GPU 사용률·GPU 메모리 사용률: GPU 대상을 고르지 않으면 모든 GPU 중 가장 높은 값으로 판단합니다. GPU가 없거나 수집이 꺼져 있으면 미지원입니다.

웹사이트 오류 감시 ​

사이트 5xx 비율 또는 사이트 평균 응답 시간을 고르고 사이트, 임계값, **판단 최소 요청 수(최근 60초)**를 입력합니다. 에이전트가 웹서버 접근 로그에서 최근 60초 요청을 모아 판단하며, 요청이 최소 수보다 적으면 판단을 보류합니다.

응답 시간 감시는 웹서버 로그에 request_time이 있어야 합니다. upstream_response_time도 있으면 사이트 상세와 AI 진단에 업스트림 응답 시간이 함께 나옵니다.

감시가 동작하지 않을 때 ​

  • 미지원: 에이전트가 오래되었거나 그 운영체제에서 수집하지 않는 항목입니다. CPU I/O 대기와 부하 평균은 Linux만 수집합니다. 프로세스 감시는 서버 수집 설정의 프로세스, GPU 감시는 GPU 수집이 켜져 있어야 합니다.
  • 잠시 멈춤: 서버 수집 설정에서 관련 항목(연결 수·네트워크 I/O·디스크 I/O 등)을 끄면 감시도 멈춥니다.
  • 감시 건강: 에이전트·작업 큐·저장·발송 상태를 보여 줍니다. 감시가 늦거나 알림이 오지 않으면 먼저 확인하세요.

각 감시에는 마지막 검사 시각, 현재 관측값, 실패 이유가 표시됩니다. 알림을 받으려면 알림 채널도 설정해야 합니다.

도움말 내용은 서비스 업데이트에 따라 바뀔 수 있습니다.