GPU 메트릭
WhaTap 서버 모니터링의 GPU 성능 메트릭은 NVIDIA GPU 환경에서 GPU 서버, 개별 GPU, GPU 사용 프로세스, GPU 장애 이벤트 관점의 성능 및 상태 정보를 수집하여 제공합니다. GPU 사용률, 연산 자원 활용도, 메모리 사용량, 전력, 온도, 클럭, PCIe/NVLink 전송량, ECC 오류, 성능 제한 상태, Xid 이벤트 등을 확인할 수 있으며, GPU 서버의 전체 활용 수준 파악부터 개별 GPU 병목 분석, 프로세스 단위 원인 추적, 드라이버·하드웨어 이상 이벤트 확인까지 단계적으로 분석할 수 있습니다. 일부 지표는 Physical GPU 기준으로만 수집되며, MIG 환경에서는 수집 대상과 해석 기준이 달라질 수 있으므로 GPU Type 및 수집 대상을 함께 확인하는 것이 좋습 니다. 또한 Xid 이벤트는 NVIDIA 드라이버가 시스템 로그에 기록한 장애/이벤트 이력을 기반으로 수집합니다. 원인 분석 시 이벤트 발생 시각, GPU 식별 정보, Xid Code, PID, Task Name, 상세 메시지를 함께 확인하세요.
GPU 모니터링을 활성화하려면 에이전트 설정이 필요합니다. 자세한 내용은 GPU 기능 설정을 참조하세요.
GPU 성능 메트릭은 분석 관점에 따라 서버 전체 GPU 집계, 개별 GPU 상세, GPU 사용 프로세스, GPU Xid 이벤트 기준의 4가지 카테고리로 제공합니다.
-
infra_gpu
서버에 장착된 전체 GPU의 상태를 집계하여 GPU 서버 전체 관점의 성능과 상태를 확인할 수 있는 카테고리입니다. GPU 사용률, 메모리, 전력, 온도, 클럭, PCIe/NVLink, ECC, Violation 상태를 평균·합계·최대값 기준으로 제공하여 GPU 서버 전체의 활용 수준과 병목 가능성을 빠르게 확인할 수 있습니다.
-
infra_gpu_id
개별 GPU 단위의 성능과 상태를 제공하는 카테고리입니다. GPU별 사용률, 연산 자원 활용도, 메모리, 온도, 전력, 클럭, PCIe/NVLink, ECC, Violation 상태를 확인하여 특정 GPU에서 발생하는 병목이나 제약 상태를 분석할 수 있습니다. Physical GPU와 MIG 인스턴스에 따라 수집 가능한 지표가 다를 수 있으므로 GPU Type과 수집 대상을 함께 확인해야 합니다.
-
infra_gpu_process
GPU를 사용하는 프로세스 단위의 자원 사용 정보를 제공하는 카테고리입니다. PID, 프로세스명, 사용자, GPU UUID와 함께 SM 사용률, 메모리 컨트롤러 사용률, 인코더/디코더 사용률, FB 메모리 사용량 등을 확인하여 어떤 프로세스가 GPU 자원을 사용하고 있는지 추적할 수 있습니다. 단, 일부 프로세스별 GPU 사용률 지표는 GPU 전체 지표와 측정 기준이 다를 수 있으므로 개별 프로세스의 기여도를 판단할 때는 GPU 전체 지표와 함께 해석하는 것이 좋습니다.
-
infra_gpu_xid
NVIDIA 드라이버가 기록한 GPU Xid 이벤트 정보를 제공하는 카테고리입니다.
/var/log/messages또는 시스템 로그에 기록된NVRM: Xid로그를 기반으로 Xid Code, GPU Index, PCI Bus ID, 발생 시각, PID, Task Name, 상세 메시지를 수집하여 GPU 드라이버, 하드웨어, PCIe, 메모리, 애플리케이션 오류 등 GPU 이상 이벤트를 추적할 수 있습니다. 모든 Xid 이벤트가 즉시 하드웨어 장애를 의미하지는 않으므로 Xid Code의 의미, 발생 빈도, 동시점의 GPU 성능 지표, 프로세스 정보, 시스템 로그를 함께 확인하여 해석하는 것이 좋습니다.