GPU 대시보드
GPU 대시보드는 GPU 자원 구성, 활용 효율, 이슈 이력을 한 화면에서 통합적으로 조회하는 AI 인프라 운영 대시보드입니다. GPU 서버가 여러 대로 늘어나면 개별 서버를 하나씩 확인하기 어렵습니다. GPU 대시보드는 전체 GPU 자원을 모델별·서버별로 모아 보여 주어 활용 현황과 이상 징후를 빠르게 파악하도록 돕습니다.
지원 환경
서버 환경의 GPU 모니터링에 대한 개요는 WhaTap GPU 모니터링 문서를 참조하세요.
기본 화면 안내
GPU 대시보드는 두 개의 탭으로 구성됩니다.
-
GPU 운영 현황: GPU 자원의 보유 현황, 활용 효율, 전력 소비, 이슈를 위젯 단위로 모아 보여 줍니다.
-
GPU 리소스 보드: 전체 GPU의 할당·활용 상태를 요약 바와 맵 형태로 조망합니다.
옵션바
화면 상단의 옵션바에서 조회 조건을 조정할 수 있습니다.
-
시간 선택: 조회할 시간 범위를 지정합니다.
-
필터: 특정 모델, 서버 등 조건에 맞는 GPU만 조회하도록 필터를 지정합니다.
-
보기 전환: 위젯의 표시 형태를 전환합니다.
-
프리셋(Preset): 자주 사용하는 필터와 Top 5 지표 선택 조합을 프리셋으로 저장하고 다시 불러올 수 있습니다.
GPU 운영 현황 탭
GPU 운영 현황 탭은 다음 위젯을 제공합니다.
GPU 인벤토리(모델별)
보유한 GPU를 모델별로 집계해 도넛 형태로 보여 줍니다. 도넛의 모델 조각이나 범례를 클릭하면 해당 모델로 필터가 적용된 GPU 인벤토리가 새 탭으로 열립니다.
GPU 전력 소비 추이
GPU의 전력 소비 추이를 시간 흐름에 따라 보여 줍니다.
표시되는 전력 소비량은 GPU 지표를 기반으로 산출한 추정값이며, 실제 전력계 측정값과 차이가 있을 수 있습니다.
GPU 모델별 서버 심각도 분포
GPU 모델별로 해당 모델이 장착된 서버의 진행 중 이벤트 현황과 대표 심각도 분포를 누적 막대 형태로 보여 줍니다. 발생 x / 전체 y 서버는 해당 GPU 모델이 장착된 전체 서버 중 현재 하나 이상의 이벤트가 발생한 서버 수를 의미합니다. 각 서버의 심각도는 해당 서버에서 진행 중인 이벤트 가운데 가장 높은 심각도를 기준으로 분류하며, 위험·경고·정보·정상별 서버 수로 표시합니다. 총 이벤트 n건은 이벤트가 발생한 서버들에서 현재 진행 중인 전체 이벤트 수를 의미합니다. 항목을 클릭하면 해당 GPU 모델이 장착된 서버들을 대상으로 진행 중인 이벤트 목록을 드로어에서 확인할 수 있습니다.
Top 5 Server / Top 5 GPU
지정한 지표를 기준으로 상위 5개 서버(Top 5 Server)와 GPU(Top 5 GPU)를 각각 별도 패널로 보여 줍니다. 기본 기준 지표는 서버가 GPU 사용률, GPU가 전력 제한 위반율입니다. 항목을 클릭하면 해당 대상의 최근 추이를 확인할 수 있는 드로어가 열립니다. 기준 지표는 옵션바 또는 프리셋에서 변경할 수 있습니다.
Xid
GPU에서 발생한 Xid 이벤트 이력을 보여 줍니다. Xid 이벤트를 활용한 이상 탐지 방법은 WhaTap GPU 모니터링 문서를 참조하세요.