서버 메트릭 V2
홈 화면 > 프로젝트 선택 > 분석 > 메트릭스 조회
메트릭스 조회 메뉴에서 검색할 수 있는 메트릭입니다. 메트릭은 아래와 같은 정보를 포함합니다. 일부 메트릭에는 태그 정보가 없을 수 있습니다.
- Tags: 수집 대상을 식별하는 정보 (에이전트 이름, IP 등)
- Fields: 실제 측정값 (CPU 사용률, 응답 시간 등)
WhaTap 서버 모니터링의 CategoryV2 메트릭은 운영 환경의 서버 자원을 도메인 단위로 표준화한 메트릭 체계입니다. CPU, 메모리, Swap, 커널과 같은 핵심 시스템 자원부터 디스크 장치 I/O, 파일시스템, 네트워크 트래픽, NIC 구성, NTP 동기화, 프로세스, Windows 서비스, InfiniBand, ZFS, Veritas LV 등 주요 인프라 지표를 Linux, Windows, Unix(HP-UX, AIX, Solaris) 기반의 온프레미스 및 클라우드 서버 환경 전반에서 일관된 구조로 제공합니다.
CategoryV2는 전체 서버의 자원 사용 현황을 비교하는 카테고리와, 서버별 구성 요소를 세부 인스턴스 단위로 분석하는 카테고리를 함께 제공합니다. 운영자는 이를 통해 전체 인프라의 자원 분포와 이상 징후를 빠르게 파악하고, 문제가 발생한 서버의 세부 구성 요소까지 단계적으로 추적할 수 있습니다.
기존 CategoryV1이 여러 도메인의 지표를 일부 카테고리에 묶어 제공했다면, CategoryV2는 도메인별 카테고리 분리와 지표 특성에 따른 수집 주기 차등화로 분석 구조와 수집 효율을 개선했습니다. 수집한 CategoryV2 메트릭은 메트릭스 익스플로러와 연동되므로, 사용자가 원하는 지표를 직접 조회하고 다양한 조건으로 상세 분석할 수 있습니다.
CategoryV2는 에이전트 설정에서 categoryv2.enabled=true 옵션을 활성화하면 사용할 수 있습니다.
CategoryV2 메트릭 상세
infra_cpu
서버 전체 CPU 자원의 사용 상태를 수집하는 카테고리입니다. 사용자 모드, 커널 모드, I/O 대기, idle, interrupt, steal, load average 등 CPU 전반의 사용률과 부하 수준을 확인하기 위한 지표를 제공합니다. 서버의 전반적인 CPU 병목 여부와 시스템 부하 상태를 파악할 때 사용합니다.
- 카테고리: CPU
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
cpu | CPU | % | 100%에서 idle(유휴) 비율을 제외한 전체 CPU 사용률을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
user | User | % | 전체 CPU 시간 중 사용자 모드(User mode) 에서 일반 애플리케이션/프로세스를 실행하는 데 사용된 비율을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
sys | Sys | % | 전체 CPU 시간 중 커널 모드(System mode) 에서 시스템 콜 처리, 커널 작업, 드라이버 처리 등에 사용된 비율을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
nice | Nice | % | 전체 CPU 시간 중 낮은 우선순위(niced) 사용자 프로세스 실행에 사용된 비율을 의미합니다. 일반 우선순위의 사용자 프로세스 사용률은 보통 user(%)에 포함됩니다. | HP-UX, AIX, Solaris, Linux |
wait | Wait | % | 전체 CPU 시간 중 CPU가 I/O 완료를 기다리며 유휴 상태로 있었던 비율(I/O wait) 을 의미합니다. CPU가 실제 연산을 수행한 시간이 아니라, 디스크/네트워크 등 외부 자원 응답을 기다린 시간으로 해석합니다. | HP-UX, AIX, Solaris, Linux |
total | User+Sys | % | 전체 CPU 사용률 중 사용자 모드(user) 와 커널 모드(sys) 에서 사용된 비율의 합을 의미합니다. 일반적으로 I/O 대기(wait), irq, softirq, steal 등은 제외한 순수 CPU 실행 사용률로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
total_wait | User+Sys+Wait | % | 전체 CPU 시간 중 user + sys + wait 의 합을 의미합니다. 즉 사용자 처리, 커널 처리, I/O 대기를 함께 포함한 사용 지표입니다. | HP-UX, AIX, Solaris, Linux |
idle | Idle | % | 전체 CPU 시간 중 CPU가 아무 작업도 수행하지 않고 유휴 상태로 있었던 비율을 의미합니다. 값이 높을수록 CPU 여유가 많은 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
lCores | Logical Cores | count | OS에서 인식하는 논리 CPU(논리 코어) 수를 의미합니다. 물리 코어 수와 다를 수 있으며, Hyper-Threading/SMT가 활성화된 경우 논리 코어 수가 더 크게 보일 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
irq | Irq | % | 전체 CPU 시간 중 하드웨어 인터럽트(IRQ) 를 처리하는 데 사용된 비율을 의미합니다. 네트워크 카드, 디스크, 기타 하드웨어 이벤트 처리 부담이 높을 때 증가할 수 있습니다. | Linux |
softirq | Softirq | % | 전체 CPU 시간 중 소프트웨어 인터럽트(SoftIRQ) 를 처리하는 데 사용된 비율을 의미합니다. 네트워크 패킷 처리, 블록 I/O 후처리 등 커널의 지연 처리 작업이 많을 때 증가할 수 있습니다. | Linux |
steal | Steal | % | 가상화 환경에서 하이퍼바이저가 다른 가상 CPU를 우선 처리하는 동안, 현재 가상 CPU가 실행되지 못하고 빼앗긴 시간의 비율을 의미합니다. 값이 높으면 VM에 할당된 CPU 자원이 부족하거나 과경합 상태일 수 있습니다. | Linux |
procUtil | Processor Util | % | Windows 전용 지표로, 시스템 전체 프로세서의 종합 CPU 사용률을 의미합니다. Windows 작업 관리자에서 보는 전체 CPU 사용률과 같습니다. | Windows |
loadavg_1m | LoadAvg 1m | count | 최근 1분 동안의 평균 시스템 부하(load average) 를 의미합니다. 실행 중이거나 실행 대기 중인 작업, 인터럽트 불가 대기 상태의 작업 등을 반영하며, CPU 사용률과는 다른 개념입니다. | HP-UX, AIX, Solaris, Linux |
loadavg_5m | LoadAvg 5m | count | 최근 5분 동안의 평균 시스템 부하(load average) 를 의미합니다. 단기 변동보다 조금 더 완만한 추세를 보는 데 사용됩니다. | HP-UX, AIX, Solaris, Linux |
loadavg_15m | LoadAvg 15m | count | 최근 15분 동안의 평균 시스템 부하(load average) 를 의미합니다. 시스템 부하의 장기 추세를 확인하는 데 사용됩니다. | HP-UX, AIX, Solaris, Linux |
infra_mem
서버 전체 메모리 사용 상태를 수집하는 카테고리입니다. 전체 메모리 용량, 사용량, 사용률, cache, buffer, available memory, slab, page fault, swap in/out 등 메모리 전반의 사용 현황과 압박 상태를 확인하기 위한 지표를 제공합니다. 메모리 부족, reclaim, paging, cache 활용 상태를 파악할 때 사용합니다.
- 카테고리: MEMORY
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
pUsed | Used | % | 전체 메모리 대비 현재 사용 중인 메모리 비율을 의미합니다. Linux는 보통 MemAvailable을 기준으로 used = total - available에 가깝게 해석하며, page cache와 reclaim 가능한 일부 메모리는 여유 메모리로 간주합니다. Windows는 일반적으로 Available을 제외한 사용량 기준으로 해석합니다. AIX / HP-UX / Solaris는 Linux의 MemAvailable과 동일한 개념이 없으므로, 보통 OS가 제공하는 used 값을 기준으로 산출합니다. | AIX, HP-UX, Solaris, Linux, Windows |
used | Used | byte | 현재 사용 중인 메모리 사용량을 의미합니다. Linux는 보통 MemTotal - MemAvailable 값을 기준으로 Byte 단위 환산 후 사용합니다. Windows는 일반적으로 Available을 제외한 사용량 기준으로 해석합니다. AIX / HP-UX / Solaris는 Linux처럼 MemAvailable 기준이 없으므로, OS가 제공하는 used 값을 기준으로 산출합니다. | AIX, HP-UX, Solaris, Linux, Windows |
pCache | Cache | % | 전체 메모리 중 cache 영역이 차지하는 비율을 의미합니다. Linux에서는 일반적으로 /proc/meminfo의 Cached 값을 기준으로 하며, page cache 성격의 메모리를 의미하지만 Buffers나 SReclaimable은 포함하지 않습니다. AIX / HP-UX / Solaris는 Linux의 MemAvailable과 동일한 개념이 없으므로, 보통 OS가 제공하는 cache 값 기준으로 산출합니다. | HP-UX, AIX, Solaris, Linux |
cache | Cache | byte | cache로 사용되는 메모리 크기를 의미합니다. Linux에서는 일반적으로 /proc/meminfo의 Cached 값을 기준으로 하며, page cache 성격의 메모리를 의미하지만 Buffers나 SReclaimable은 포함하지 않습니다. AIX / HP-UX / Solaris는 Linux의 MemAvailable과 동일한 개념이 없으므로, 보통 OS가 제공하는 cache 값 기준으로 산출합니다. | HP-UX, AIX, Solaris, Linux |
buffer | Buffer | byte | 전체 메모리 중 I/O 버퍼로 사용되는 메모리 사용량을 Byte 단위로 나타낸 값입니다. Linux 전용 지표이며, /proc/meminfo의 Buffers 값을 기준으로 합니다. | Linux |
pUsed_pCache | Used+Cache | % | 현재 사용률(pUsed)과 cache 비율(pCache)을 함께 나타내는 지표입니다. 사용자/커널이 실제 사용 중인 메모리와 cache 영역의 비중을 함께 보기 위한 참고용 지표이며, 표준 메모리 지표라기보다는 운영 해석을 위한 합성 지표입니다. | HP-UX, AIX, Solaris, Linux |
shared | Shared Size | byte | 서버 전체에서 사용 중인 shared memory 크기를 Byte 단위로 나타낸 값입니다. Linux 전용 지표이며, tmpfs, shared memory, 일부 shared mapping 영역 등이 포함될 수 있습니다. | Linux |
size | Total Size | byte | 시스템에 할당된 전체 물리 메모리 크기를 Byte 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
available | Available | byte | 현재 사용 가능한 메모리 크기를 Byte 단위로 나타낸 값입니다. Linux에서는 /proc/meminfo의 MemAvailable을 의미하며, 단순 free 메모리뿐 아니라 reclaim 가능한 cache까지 일부 반영한 “즉시 활용 가능한 추정치”에 가깝습니다. 순간 값도 중요하지만, 시간에 따라 지속적으로 감소하고 pageMajFaults, swapIn, swapOut 이 함께 증가하는 패턴은 실제 메모리 압박이 커지고 있음을 시사할 수 있습니다. | Linux |
sreclaimable | Sreclaimable | byte | 커널 slab cache 중 필요 시 회수(reclaim) 가능한 영역의 크기를 Byte 단위로 나타낸 값입니다. 메모리 압박 시 일부 회수될 수 있습니다. 값이 크다고 해서 반드시 문제는 아니며, 현재 cache 활용 수준을 보여주는 의미도 있습니다. 다만 시간이 지나도 과도하게 증가하거나 available 감소와 함께 reclaim이 제대로 이루어지지 않는다면 추가 점검이 필요할 수 있습니다. | Linux |
sunreclaim | Sunreclaim | byte | 커널 slab cache 중 회수(reclaim)할 수 없는 영역의 크기를 Byte 단위로 나타낸 값입니다. 커널이 계속 보유해야 하는 메모리이므로 SReclaimable 보다 메모리 압박 측면에서 더 직접적인 의미를 가질 수 있습니다. 값이 지속적으로 증가하는 패턴은 커널 메모리 사용 확대 또는 비정상적인 누적 가능성을 해석하는 데 도움이 됩니다. | Linux |
slab | Slab | byte | 커널이 객체 cache 용도로 사용하는 slab 메모리의 전체 크기를 Byte 단위로 나타낸 값입니다. 일반적으로 /proc/meminfo의 Slab을 의미하며, SReclaimable + SUnreclaim의 합으로 해석합니다. 현재 값도 중요하지만, 시간에 따라 지속적으로 증가하는 경우 커널 메모리 사용 확대를 의미할 수 있으며, 특히 SUnreclaim 증가가 동반되면 회수 가능한 cache 증가가 아니라 실제 커널 메모리 압박 가능성을 함께 검토할 필요가 있습니다. | Linux |
pageFaults | Page Faults | counts/s | 시스템 전체에서 발생한 메모리 접근 과정에서 발생한 전체 page fault 건수를 초당 값으로 나타낸 지표입니다. minor fault와 major fault를 모두 포함하며, 반드시 디스크 I/O를 수반하는 것은 아닙니다. 순간 증가 자체만으로 문제라고 보기는 어렵지만, 값이 지속적으로 높아지거나 pageMajFaults, scanned, swapIn/Out 증가와 함께 나타나는 경우 메모리 압박 또는 page cache miss 증가 가능성을 해석하는 데 도움이 됩니다. | Linux |
pageMajFaults | Page Major Faults | counts/s | 시스템에서 필요한 페이지를 디스크/스토리지에서 실제로 읽어와야 했던 major page fault 건수를 초당 값으로 나타낸 지표입니 다. 읽어오는 원천은 파일시스템의 file-backed page일 수도 있고, swap 영역일 수도 있습니다. 값이 지속적으로 높거나 증가 추이를 보이면 단순 메모리 접근 증가가 아니라 실제 I/O를 수반하는 메모리 압박 가능성을 시사하며, 응답 지연과 직접적으로 연결될 수 있습니다. swapIn, fsIn, available 과 함께 보는 것이 중요합니다. | Linux |
scanned | Page Scan | pages/s | 메모리 확보를 위해 시스템이 검사(scan)한 페이지 수를 의미합니다. 값이 높아질수록 메모리 확보를 위한 reclaim 활동이 활발하다는 뜻이며, 지속적으로 높은 수준을 보이면 메모리 압박이 커지고 있음을 시사할 수 있습니다. 단발성 상승보다 장시간 지속 여부와 freed, steal, swapIn/Out 과의 관계를 함께 해석하는 것이 중요합니다. | HP-UX, AIX, Solaris, Linux |
freed | Page Free | pages/s | 페이지 회수, 페이지 해제 등으로 확보된 free 페이지 수를 의미합니다. 시스템의 reclaim 또는 메모리 반환 활동 결과를 보여주는 지표입니다. 값 자체보다 scanned 와의 관계, 그리고 지속적인 증가 여부를 함께 보는 것이 중요합니다. scanned 가 높은데 freed 가 충분히 따라오지 않으면 메모리 확보 효율이 낮아지고 있음을 시사할 수 있습니다. | HP-UX, AIX, Solaris, Linux |
steal | Page Steal | pages/s | Linux에서 페이지 reclaim 과정에서 실제로 회수된 페이지 수를 의미합니다. 메모리 부족 상황에서 page cache나 inactive page 등을 확보하는 과정과 연관됩니다. 값이 일시적으로 증가하는 것은 정상 reclaim 동작일 수 있으나, 지속적으로 높게 유지되면 시스템이 계속 메모리 압박 상태에서 페이지를 회수하고 있음을 의미할 수 있습니다. | Linux |
stealRatio | Page Steal Ratio | % | Linux에서 스캔한 페이지 중 실제로 회수된 페이지의 비율을 의미합니다. 일반적으로 steal / scanned * 100으로 계산하며, 값이 높을수록 스캔 대비 회수 효율이 높고, 값이 낮을수록 active page 비중이 높아 회수가 잘 되지 않는 상황일 수 있습니다.(0 은 의미 없음) 다만 workload 특성에 따라 해석이 달라질 수 있으므로 scanned, freed, available 과 함께 보는 것이 중요합니다. | Linux |
swapIn | Swap In | pages/s | 디스크의 swap(페이징 스페이스) 영역에서 메모리로 초당 다시 읽어온 페이지 수를 의미합니다. 값이 지속적으로 발생하거나 증가 추이를 보이면 메모리 부족으로 인해 swap 의존도가 높아지고 있음을 시사할 수 있으며, 응답 지연과 직접 연결될 가능성이 있습니다. 일시적 발생보다 지속성 여부를 더 중요하게 보는 것이 좋습니다. | HP-UX, AIX, Solaris, Linux, Windows |
swapOut | Swap Out | pages/s | 메모리에서 디스크의 swap(페이징 스페이스) 영역으로 초당 내보낸 페이지 수를 의미합니다. 값이 지속적으로 발생하면 시스템이 메모리 확보를 위해 페이지를 swap으로 밀어내고 있음을 의미합니다. swapIn 과 함께 지속적으로 높게 나타나는 패턴은 성능 저하 가능성이 큰 메모리 압박 상태를 시사할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
fsIn | Filesystem In | pages/s | 파일시스템 읽기 작업에 의해 메모리로 유입된 페이지 수를 의미합니다. Swap In과는 달리 파일시스템 I/O에 의해 로드된 페이지를 의미합니다. 현재 값도 의미가 있지만, pageMajFaults, 프로세스의 rdiskIo, available 과 함께 증가하는 패턴은 실제 파일 기반 page-in 활동이 커지고 있음을 해석하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
fsOut | Filesystem Out | pages/s | 파일시스템 쓰기 작업에 의해 디스크로 기록된 페이지 수를 의미합니다. Swap Out과는 달리 파일시스템 writeback/flush 성격의 페이지 기록량으로 해석하는 것이 적절합니다. 값의 지속 증가나 주기적 급등 패턴은 flush/writeback/checkpoint와 같은 작업 특성과 연관지어 해석할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
poolPaged | Pool Paged | byte | Windows 전용 지표로, 페이징 풀(Paged Pool)의 Byte 크기를 나타냅니다. 필요 시 디스크로 페이징될 수 있는 커널 메모리 영역을 의미합니다. | Windows |
poolNonPaged | Pool Nonpaged | byte | Windows 전용 지표로, 비페이징 풀(Nonpaged Pool)의 Byte 크기를 나타냅니다. 항상 물리 메모리에 상주해야 하는 커널 메모리 영역을 의미합니다. | Windows |
systemCacheResident | System Cache Resident | byte | Windows 전용 지표로, 현재 물리 메모리에 상주 중인 시스템 캐시 메모리의 Byte 크기를 나타냅니다. 파일 시스템 cache와 관련된 커널 메모리 사용량을 반영합니다. | Windows |
infra_swap
서버 전체 swap 또는 paging space 사용 상태를 수집하는 카테고리입니다. 전체 swap 크기, 사용량, 사용률 등을 통해 디스크 기반 가상 메모리 사용 수준을 파악할 수 있습니다. 메모리 부족으로 인한 swap 사용 여부와 전반적인 가상 메모리 압박 상태를 확인할 때 사용합니다.
- 카테고리: SWAP
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
size | Total Size | byte | 시스템에 구성된 전체 swap 영역의 크기를 Byte 단위로 나타낸 값입니다. Unix/Linux 계열에서는 swap/paging space의 총 크기를 의미하고, Windows에서는 page file 기반 가상 메모리 영역의 총 크기에 해당합니다. | HP-UX, AIX, Solaris, Linux, Windows |
pUsed | Used | % | 전체 swap 영역 대비 현재 사용 중인 swap 비율을 의미합니다. used / size * 100으로 계산합니다. 값이 높을수록 메모리 부족으로 인해 디스크 기반 가상 메모리 사용 비중이 높아졌을 가능성을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
used | Used | byte | 현재 사용 중인 swap 영역의 크기를 Byte 단위로 나타낸 값입니다. Unix/Linux 계열에서는 swap/paging space에서 실제 점유 중인 공간을 의미하고, Windows에서는 page file 사용량에 해당하는 값을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_kernel
OS 커널 및 시스템 동작 상태를 수집하는 카테고리입니다. run queue, block queue, context switch, interrupt, syscall, fork, exec 등 커널 및 스케줄러 관점의 동작 지표를 제공합니다. CPU 경합, I/O 대기, 스케줄링 부하, 커널 진입 빈도 등을 파악할 때 사용합니다.
- 카테고리: System Kernel
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
runq | RunQueue | count | 실행 준비가 완료되었지만 아직 CPU를 할당받지 못해 실행 대기열(run queue)에 있는 프로세스 또는 스레드 수를 의미합니다. 값이 높을수록 CPU 경합이 있거나 실행 가능한 작업이 CPU 자원보다 많다는 것을 시사할 수 있습니다. runq는 CPU 사용률과 함께 보는 것이 중요합니다. CPU 사용률이 높고 runq도 높으면 CPU 병목 가능성이 크고, CPU 사용률은 낮은데 runq가 높으면 lock, 스케줄링, 우선순위 문제를 의심할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
blockq | BlockQueue | count | I/O, paging, 자원 대기 등으로 인해 즉시 실행할 수 없는 상태로 대기 중인 프로세스 또는 스레드 수를 의미합니다. 일반적으로 디스크 I/O, 메모리 대기, 자원 경합이 많을 때 증가할 수 있습니다. 값이 높다는 것은 CPU 부족보다는 I/O, paging, 자원 대기 측 병목 가능성을 시사합니다. 디스크 성능 지표와 swap 지표를 함께 보는 것이 좋습니다. | HP-UX, AIX, Solaris, Linux |
pendingq | PendingQueue | count | AIX 전용 지표로, 일반적으로 raw device I/O 요청에 대해 아직 완료 응답을 받지 못하고 대기 중인 스레드 수를 의미합니다. 스토리지 응답 지연이나 raw I/O 경합이 클 때 증가할 수 있습니다. | AIX |
waitq | WaitQueue | count | HP-UX / Solaris 계열 지표로, 주로 swap out되었거나 일시적으로 스케줄 대상에서 제외되어 대기 중인 프로세스 또는 스레드 수를 의미합니다. 단순 run queue와 달리 즉시 CPU를 받아 실행 가능한 상태와는 구분됩니다. | HP-UX, Solaris |
fork | Fork | counts/s | 초당 fork() 호출 횟수를 의미합니다. fork는 현재 프로세스를 복제하여 새로운 자식 프로세스를 생성하는 시스템 호출입니다. 값이 높으면 짧은 생명주기의 프로세스 생성이 빈번한 환경일 수 있습니다. 쉘 스크립트, 배치 작업, CGI/프로세스형 애플리케이션처럼 프로세스를 자주 생성하는 환경에서 자연스럽게 높을 수 있으므로, 평소 대비 급증했는지가 더 중요합니다. | HP-UX, AIX, Solaris, Linux |
exec | Exec | counts/s | 초당 exec() 호출 횟수를 의미합니다. exec는 현재 프로세스의 PID를 유지한 채, 프로세스의 메모리 이미지와 실행 내용을 새로운 프로그램으로 교체하는 시스템 호출입니다. fork처럼 새 프로세스를 생성하는 것이 아니라 기존 프로세스를 다른 프로그램으로 대체합니다. 쉘 스크립트, 배치 작업, CGI/프로세스형 애플리케이션처럼 프로그램 교체가 빈번한 환경에서 자연스럽게 높을 수 있으므로, 평소 대비 급증했는지가 더 중요합니다. | HP-UX, AIX, Solaris |
interrupt | Interrupt | counts/s | 초당 CPU가 하드웨어 인터럽트를 처리한 횟수를 의미합니다. 네트워크, 디스크, 타이머, 기타 디바이스 이벤트가 많을수록 증가할 수 있습니다. 값이 높으면 네트워크 패킷 처리량 증가, 스토리지 I/O 증가, 특정 디바이스 인터럽트 편중 여부 등을 함께 분석하는 것이 좋습니다. | HP-UX, AIX, Solaris, Linux, Windows |
syscall | SystemCall | counts/s | 초당 커널이 처리한 시스템 호출(system call) 횟수를 의미합니다. 사용자 프로세스가 파일 I/O, 네트워크, 프로세스 제어 등 커널 서비스를 요청할 때 증가합니다. 값이 높다고 해서 반드시 이상은 아니지만, workload 특성 변화나 커널 진입 빈도 증가를 반영할 수 있습니다. 파일/소켓 I/O가 많은 애플리케이션에서 높게 나타날 수 있습니다. | HP-UX, AIX, Solaris, Windows |
ctxswitch | ContextSwitch | counts/s | 초당 문맥 전환(context switch) 횟수를 의미합니다. 실행 중인 프로세스 또는 스레드에서 다른 작업으로 CPU가 전환될 때 증가합니다. 값이 높을수록 멀티태스킹, 스레드 경쟁, lock 경합, 짧은 작업 단위 처리 등이 많을 가능성이 있습니다. ctxswitch가 매우 높으면 CPU가 실제 작업 수행보다 스케줄링 전환 비용에 더 많은 시간을 쓰고 있을 가능성이 있으므로, runq, syscall, interrupt, lock 경합 상황과 함께 보는 것이 좋습니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_disk
서버에 연결된 전체 물리 디스크의 집계 성능을 수집하는 카테고리입니다. 읽기/쓰기 처리량(Byte/s), IOPS 등 서버 전체 디스크 I/O 규모를 확인하기 위한 지표를 제공합니다. 서버 전반의 디스크 부하 수준을 파악할 때 사용합니다.
- 카테고리: DISK
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
read | Read | bytes/s | 서버의 모든 물리 디스크에서 초당 읽은 데이터 처리량의 합을 Byte/s 단위로 나타낸 값입니다. 즉 서버 전체 물리 디스크의 읽기 throughput 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
write | Write | bytes/s | 서버의 모든 물리 디스크에서 초당 쓴 데이터 처리량의 합을 Byte/s 단위로 나타낸 값입니다. 즉 서버 전체 물리 디스크의 쓰기 throughput 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
total | IO Total | bytes/s | 서버의 모든 물리 디스크에서 초당 읽기와 쓰기 처리량을 합산한 전체 데이터 처리량을 Byte/s 단위로 나타낸 값입니다. read + write에 해당하는 서버 전체 디스크 I/O throughput 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
readIops | Read IOPS | counts/s | 서버의 모든 물리 디스크에서 초당 처리된 읽기 I/O 작업 수의 합을 IOPS 단위로 나타낸 값입니다. 즉 서버 전체 물리 디스크의 읽기 IOPS 집계값입니다. IOPS는 디스크가 초당 처리한 I/O 요청 건수를 나타내는 지표로, 데이터 크기 자체는 반영하지 않습니다. 따라서 작은 블록 I/O가 많은 환경에서는 IOPS가 높고 처리량(Byte/s)은 상대적으로 낮을 수 있으며, 큰 블록 I/O가 많은 환경에서는 IOPS가 낮아도 처리량(Byte/s)은 높게 나타날 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
writeIops | Write IOPS | counts/s | 서버의 모든 물리 디스크에서 초당 처리된 쓰기 I/O 작업 수의 합을 IOPS 단위로 나타낸 값입니다. 즉 서버 전체 물리 디스크의 쓰기 IOPS 집계값입니다. IOPS는 디스크가 초당 처리한 I/O 요청 건수를 나타내는 지표로, 데이터 크기 자체는 반영하지 않습니다. 따라서 작은 블록 I/O가 많은 환경에서는 IOPS가 높고 처리량(Byte/s)은 상대적으로 낮을 수 있으며, 큰 블록 I/O가 많은 환경에서는 IOPS가 낮아도 처리량(Byte/s)은 높게 나타날 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalIops | Total IOPS | counts/s | 서버의 모든 물리 디스크에서 초당 처리된 읽기와 쓰기 I/O 작업 수를 합산한 전체 I/O 작업 수를 IOPS 단위로 나타낸 값입니다. readIops + writeIops에 해당하는 서버 전체 디스크 I/O 작업 수 집계값입니다. IOPS는 디스크가 초당 처리한 I/O 요청 건수를 나타내는 지표로, 데이터 크기 자체는 반영하지 않습니다. 따라서 작은 블록 I/O가 많은 환경에서는 IOPS가 높고 처리량(Byte/s)은 상대적으로 낮을 수 있으며, 큰 블록 I/O가 많은 환경에서는 IOPS가 낮아도 처리량(Byte/s)은 높게 나타날 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
busyMax | Busy Max | % | 서버에 연결된 모든 물리 디스크 중, 수집 구간에서 가장 높은 busy(%) 값을 가진 디스크의 사용률을 나타냅니다. 즉, 서버 전체 디스크 중 가장 바쁘게 동작한 디스크의 busy 수준을 의미합니다. 값이 높을수록 특정 디스크에 I/O 부하가 집중되었거나 병목 가능성이 있음을 의미할 수 있습니다. 다만 이 값은 기본 2초 주기로 수집되고, 개별 디스크 성능 지표에서의 busy 값은 기본 5초 주기로 수집되므로, 동일 시각의 차트에서도 개별 디스크 busy 값과 완전히 일치하지 않을 수 있습니다. 특히 낮은 busy 구간이나 순간적인 부하 증가 구간에서는 수집 구간과 샘플링 시점 차이로 값 차이가 더 크게 보일 수 있습니다. 따라서 이 값은 서버 단위의 디스크 부하 징후를 빠르게 확인하는 대표 지표로 활용하고, 실제 병목 디스크 확인은 디스크별 상세 지표를 함께 보는 것이 좋습니다. | HP-UX, AIX, Solaris, Linux, Windows |
diskName | Busy Disk | string | 서버에 연결된 모든 물리 디스크 중 가장 높은 busy(%) 값을 가진 디스크의 이름을 표시한 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_network
서버의 전체 네트워크 사용량과 인터페이스별 사용 수준을 집계하여 제공하는 카테고리입니다. Loopback을 제외한 NIC의 송수신 bps, 송수신 pps, 전체 트래픽, 최대 NIC 사용률 및 해당 NIC 이름을 수집합니다. 이를 통해 서버 전체의 네트워크 부하 추이를 확인하고, 네트워크 사용률이 가장 높은 인터페이스를 식별할 수 있습니다.
- 카테고리: NETWORK
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
rxbps | Net Rx | bps | 서버의 모든 NIC(loopback 제외)를 통해 초당 수신(Rx)된 전체 데이터 전송량의 합을 bps(bit per second) 단위로 나타낸 값입니다. 즉 서버 전체 네트워크 수신 대역폭 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
txbps | Net Tx | bps | 서버의 모든 NIC(loopback 제외)를 통해 초당 송신(Tx)된 전체 데이터 전송량의 합을 bps(bit per second) 단위로 나타낸 값입니다. 즉 서버 전체 네트워크 송신 대역폭 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalbps | Net Total | bps | 서버의 모든 NIC(loopback 제외)를 통해 초당 수신(Rx)과 송신(Tx)된 전체 데이터 전송량을 합산한 값을 bps(bit per second) 단위로 나타낸 값입니다. rxbps + txbps에 해당하는 서버 전체 네트워크 대역폭 집계값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
rxpps | Rx PPS | counts/s | 서버의 모든 NIC(loopback 제외)를 통해 초당 수신(Rx)된 패킷 수의 합을 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. 즉 서버 전체 네트워크 수신 패킷 처리량 집계값입니다. pps는 전송량 크기와 무관하게 패킷 개수 기준이므로, 작은 패킷이 많으면 pps는 높고 bps는 상대적으로 낮을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
txpps | Tx PPS | counts/s | 서버의 모든 NIC(loopback 제외)를 통해 초당 송신(Tx)된 패킷 수의 합을 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. 즉 서버 전체 네트워크 송신 패킷 처리량 집계값입니다. pps는 전송량 크기와 무관하게 패킷 개수 기준이므로, 작은 패킷이 많으면 pps는 높고 bps는 상대적으로 낮을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalpps | Total PPS | counts/s | 서버의 모든 NIC(loopback 제외)를 통해 초당 수신(Rx)과 송신(Tx)된 전체 패킷 수를 합산한 값을 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. rxpps + txpps에 해당하는 서버 전체 네트워크 패킷 처리량 집계값입니다. pps는 전송량 크기와 무관하게 패킷 개수 기준이므로, 작은 패킷이 많으면 pps는 높고 bps는 상대적으로 낮을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
linkUsageMax | NIC Max Usage | % | 서버에 존재하는 모든 NIC(loopback 제외) 중 링크 사용률(linkUsage)이 가장 높은 NIC의 사용률 값을 백분율(%)로 나타낸 값입니다. 서버 전체 네트워크 인터페이스 중 어느 NIC가 가장 높은 부하 상태인지 빠르게 확인하기 위한 지표입니다. 일반적으로 각 NIC의 linkUsage 값 중 최대값에 해당하며, linkSpeed 정보를 확인할 수 없는 NIC는 계산 대상에서 제외되거나 값이 반영되지 않을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
nicName | Max Usage NIC Name | string | 서버에 존재하는 모든 NIC(loopback 제외) 중 링크 사용률(linkUsage)이 가장 높은 NIC의 이름을 나타낸 값입니다. linkUsageMax 값이 어떤 NIC에서 발생했는지를 식별하기 위한 항목입니다. 예를 들어 Linux의 eth0, ens192, bond0, Windows의 어댑터 이름 등이 표시될 수 있습니다. 계산 가능한 NIC가 없는 경우에는 값이 비어 있을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_netstat
서버의 TCP 네트워크 연결 상태를 상태별로 집계한 정보입니다.
- 카테고리: Network State Summary
- 기본 수집 주기: 60초
- 최소 지원 에이전트: Linux 2.9.18+, Windows 2.9.18+, AIX 1.4.9+, Solaris 1.4.9+, HP-UX 1.4.9+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
netstat_Listen | Listen | count | 현재 서버에서 외부 연결 요청을 받을 수 있도록 대기 중인 LISTEN 상태의 TCP 소켓 개수입니다. 주로 서비스 포트가 정상적으로 열려 있는지 확인할 때 사용합니다. | HP-UX, AIX, Solaris, Linux |
netstat_Established | Established | count | 현재 서버에서 연결이 정상적으로 수립되어 데이터 송수신이 가능한 ESTABLISHED 상태의 TCP 연결 개수입니다. 실제로 통신 중인 세션 수를 나타냅니다. | HP-UX, AIX, Solaris, Linux |
netstat_Close_Wait | Close_Wait | count | 원격 측에서 연결 종료를 요청했으나, 아직 로컬 애플리케이션이 소켓을 완전히 닫지 않은 CLOSE_WAIT 상태의 TCP 연결 개수입니다. 이 값이 지속적으로 많으면 애플리케이션의 소켓 정리 지연 또는 누수 가능성을 점검할 필요가 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Closing | Closing | count | 양쪽 모두 연결 종료 절차를 진행 중인 CLOSING 상태의 TCP 연결 개수입니다. 일반적으로 짧게 나타나며, 지속적이거나 과도하게 증가하면 비정상적인 종료 처리 여부를 확인할 필요가 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Fin_Wait1 | Fin_Wait1 | count | 로컬 측이 연결 종료를 시작하여 FIN을 전송한 뒤, 상대 측의 응답을 기다리는 FIN_WAIT1 상태의 TCP 연결 개수입니다. 연결 종료 절차의 초기 단계에 해당합니다. | HP-UX, AIX, Solaris, Linux |
netstat_Fin_Wait2 | Fin_Wait2 | count | 로컬 측이 연결 종료 요청에 대한 응답을 받은 뒤, 원격 측의 최종 종료 신호를 기다리는 FIN_WAIT2 상태의 TCP 연결 개수입니다. 이 상태가 오래 유지되면 종료 지연 또는 상대 측 처리 문제 가능성을 의심할 수 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Time_Wait | Time_Wait | count | 연결 종료 후 지연 패킷 처리와 동일한 소켓 재사용 충돌 방지를 위해 일정 시간 유지되는 TIME_WAIT 상태의 TCP 연결 개수입니다. 짧은 연결이 매우 많은 환경에서는 값이 크게 증가할 수 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Syn_Recv | Syn_Recv | count | 원격 측의 연결 요청(SYN)을 수신하고, 이에 응답한 뒤 최종 확인을 기다리는 SYN_RECV 상태의 TCP 연결 개수입니다. 값이 급격히 증가하면 연결 요청 급증이나 SYN Flood 성격의 이상 여부를 함께 점검할 필요가 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Syn_Sent | Syn_Sent | count | 로컬 측이 연결 요청(SYN)을 전송한 후, 상대 측의 응답을 기다리는 SYN_SENT 상태의 TCP 연결 개수입니다. 원격 서버 응답 지연, 네트워크 경로 문제, 방화벽 이슈 등이 있을 때 증가할 수 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Last_Ack | Last_Ack | count | 원격 측의 종료 요청을 수신한 뒤, 로컬 측도 종료 응답을 보내고 마지막 확인을 기다리는 LAST_ACK 상태의 TCP 연결 개수입니다. 일반적으로 짧게 유지되며, 지속적으로 많으면 종료 처리 지연 여부를 확인할 필요가 있습니다. | HP-UX, AIX, Solaris, Linux |
netstat_Unknown | Unknown | count | 정의된 주요 TCP 상태로 분류되지 않았거나 수집 시점에 상태를 명확히 식별하지 못한 연결 개수입니다. 일반적으로 값이 크지 않아야 하며, 지속적으로 증가하면 수집 로직 또는 OS별 상태 매핑 기준을 점검할 필요가 있습니다. | HP-UX, AIX, Solaris, Linux |
infra_ntp_info
서버의 시간 동기화 상태를 수집하는 카테고리입니다. NTP 사용 여부, 동기화 데몬, 동기화 상태, 사용 중인 NTP 서버, offset, offset 방향, time zone 등을 제공합니다. 시스템 시간이 기준 시간과 얼마나 차이가 나는지, NTP 동기화가 정상인지 확인할 때 사용합니다.
- 카테고리: NTP Information
- 기본 수집 주기: 60초
- 최소 지원 에이전트: Linux 2.9.18+, Windows 2.9.18+, AIX 1.4.9+, Solaris 1.4.9+, HP-UX 1.4.9+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
checkTime | Check Time | string | NTP 정보 수집 또는 점검이 수행된 시각을 의미합니다. 해당 결과가 생성된 시점의 Agent 가 설치된 서버의 로컬 시스템 시간을 표시합니다. | HP-UX, AIX, Solaris, Linux, Windows |
ntpInUse | NTP In Use | string | 해당 시스템에서 NTP 기반 시간 동기화 기능을 사용 중인지 여부를 나타냅니다. Yes 는 NTP 또는 시간 동기화 데몬이 설정되어 사용 중인 상태, No 는 사용하지 않거나 관련 데몬이 동작하지 않는 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
ntpDaemon | NTP Daemon | string | 해당 시스템에서 사용 중인 시간 동기화 데몬 또는 서비스 이름을 나타냅니다. 예를 들어 Linux/Unix 계열에서는 chrony, ntpd, xntpd, Windows에서는 w32time 등이 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
timeSynced | Time Synced | string | 현재 시스템이 NTP 서버와 정상적으로 시간 동기화된 상태인지 여부를 나타냅니다. Yes는 현재 유효한 NTP 서버와 동기화 중인 상태, No 는 NTP는 사용 중이지만 아직 동기화되지 않았거나 유효한 동기화 대상을 확보하지 못한 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
ntpServer | NTP Server | string | 현재 시간 동기화에 사용 중인 NTP 서버의 호스트명 또는 IP 주소를 나타냅니다. 동기화가 정상적으로 이루어지지 않은 경우 값이 비어 있을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
offset | Offset (ms) | ms | 현재 시스템 시간과 기준 NTP 서버 시간 사이의 차이값을 ms(밀리초) 단위의 절대값으로 나타낸 값입니다. 빠른지 느린지에 대한 방향 정보는 offsetDirection 필드에서 구분합니다. | HP-UX, AIX, Solaris, Linux, Windows |
offsetDirection | Offset Direction | string | 현재 시스템 시간이 기준 NTP 서버 시간보다 빠른지 또는 느린지를 나타냅니다. 예를 들어 FAST(+)는 로컬 시스템 시간이 더 빠른 상태, SLOW(-)는 로컬 시스템 시간이 더 느린 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
timeZone | Time Zone | string | 해당 시스템에 설정된 시간대 정보를 나타냅니다. 운영체제에 따라 Asia/Seoul, KST, Korea Standard Time 등 서로 다른 형식으로 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_process
서버 전체 프로세스 상태를 집계하여 보여주는 카테고리입니다. 전체 프로세스 수, 스레드 수, zombie 수, runnable/sleeping 상태 수, file descriptor 사용량 등 프로세스/스레드 전반의 상태를 확인할 수 있습니다. 프로세스 수 급증, zombie 누적, FD 고갈 등 시스템 운영 상태를 파악할 때 사용합니다.
- 카테고리: Process State Summary
- 기본 수집 주기: 2초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
procTotal | Process Total | count | OS에서 현재 존재하는 전체 프로세스 수를 의미합니다. 프로세스 수가 많다고 해서 반드시 이상은 아닙니다. 배치, 웹서버 prefork 구조, 짧은 작업 단위가 많은 환경에서는 자연스럽게 높을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
threadTotal | Thread Total | count | OS에서 현재 존재하는 전체 스레드 수를 의미합니다. 멀티스레드 애플리케이션이 많을수록 증가할 수 있으며, 프로세스 수보다 시스템 부하를 더 직접적으로 반영하는 경우도 있습니다. 스레드 수는 프로세스 수보다 실제 동시성 수준을 더 잘 보여줄 수 있습니다. Java, WAS, DB, 멀티스레드 앱 환경에서는 threadTotal 추세가 중요합니다. | HP-UX, AIX, Solaris, Linux, Windows |
handleTotal | Handle Total | count | Windows OS에서 현재 열려 있거나 사용 중인 전체 Handle 수를 의미합니다. 파일, 레지스트리 키, 프로세스, 스레드, 이벤트, 뮤텍스 등 다양한 커널 객체에 대한 참조 수를 포함합니다. | Windows |
runnableTotal | Runnable Total | count | Linux에서 process state가 R인 프로세스 수를 의미합니다. 현재 실행 중이거나, 실행 가능하지만 CPU를 기다리며 run queue에 올라가 있는 프로세스를 포함합니다. | Linux |
sleepingTotal | Sleeping Total | count | Linux에서 process state가 S인 프로세스 수를 의미합니다. 인터럽트 가능한 sleep 상태로, 이벤트나 자원 응답을 기다리다가 신호에 의해 깨어날 수 있는 프로세스를 포함합니다. 일반적인 대기 상태 프로세스가 가장 많이 분포하는 구간입니다. | Linux |
idleTotal | Idle Total | count | Linux에서 process state가 I인 프로세스 수를 의미합니다. 커널 스케줄러 관점에서 idle 상태로 표시되는 태스크 수를 의미하며, 일반 사용자 프로세스보다는 커널 내부 worker나 idle 계열 태스크에서 보일 수 있습니다. | Linux |
disksleepTotal | Disk Sleep Total | count | Linux에서 process state가 D인 프로세스 수를 의미합니다. 인터럽트 불가능한 대기(uninterruptible sleep) 상태로, 주로 디스크 I/O, 파일시스템, 디바이스, 커널 자원 대기 중인 프로세스가 포함됩니다. 값이 높고 지속되면 스토리지 또는 커널 대기 병목을 의심할 수 있습니다. | Linux |
zombieTotal | Zombie Total | count | 종료되었지만 아직 부모 프로세스에 의해 회수되지 않아 zombie(Z) 상태로 남아 있는 프로세스 수를 의미합니다. 지속적으로 증가하면 부모 프로세스의 wait 처리 문제나 프로세스 회수 지연을 의심할 수 있습니다. | HP-UX, AIX, Solaris, Linux |
stoppedTotal | Stopped Total | count | Linux에서 process state가 T인 프로세스 수를 의미합니다. 일반적으로 job control 신호(SIGSTOP, SIGTSTP 등)에 의해 중지된 프로세스를 나타냅니다. | Linux |
tracingstopTotal | Tracing Stop Total | count | Linux에서 process state가 t인 프로세스 수를 의미합니다. 일반적으로 디버거(ptrace) 등에 의해 tracing stop 상태로 중지된 프로세스를 나타냅니다. | Linux |
deadTotal | Dead Total | count | Linux에서 process state가 X인 프로세스 수를 의미합니다. 종료 처리 중이거나 완전히 종료된 상태를 의미하지만 일반적인 운영 환경에서는 거의 관측되지 않습니다. | Linux |
wakekillTotal | Wake Kill Total | count | Linux에서 process state가 K인 프로세스 수를 의미합니다. 커널 내부 상태로 분류되는 경우가 있으며, 일반적인 운영 환경에서는 거의 관측되지 않거나 커널 버전에 따라 의미가 달라질 수 있습니다. | Linux |
wakingTotal | Waking Total | count | Linux에서 process state가 W인 프로세스 수를 의미합니다. 깨우기(waking) 처리 중인 전이 상태로 볼 수 있으며, 최신 커널에서는 거의 보이지 않거나 환경 의존적으로만 관측될 수 있습니다. | Linux |
otherTotal | Other Total | count | Linux에서 명시적으로 분리한 R/S/I/D/Z/T/t/X/K/W 이외의 기타 process state를 가진 프로세스 수를 의미합니다. 커널 버전 차이, 관측 순간의 전이 상태, 구현 차이에 따라 포함 대상이 달라질 수 있습니다. | Linux |
openfdCurrent | Open fd Used | count | Linux OS 전체에서 현재 사용 중인 file descriptor 수를 의미합니다. 파일, 소켓, 파이프, 디바이스 등 커널이 file descriptor로 관리하는 열린 객체 수를 포함합니다. | Linux |
openfdMax | Open fd Max | count | Linux OS 전체에서 설정된 최대 file descriptor 수를 의미합니다. 일반적으로 시스템 전체 파일 디스 크립터 한계(/proc/sys/fs/file-max) 기준으로 해석합니다. | Linux |
openfdPUsed | Open fd Used | % | Linux OS 전체 file descriptor 사용률을 의미합니다. 일반적으로 openfdCurrent / openfdMax * 100으로 계산하며, 값이 높을수록 시스템 전역 FD 고갈 위험이 커집니다. | Linux |
infra_nic_info
서버 내 각 네트워크 인터페이스의 구성 정보를 수집하는 카테고리입니다. NIC 이름, IP, MAC, link, state, duplex, speed, mode, driver 등의 정적 또는 반정적 정보를 제공합니다. NIC 구성 변경 감시, 이중화 구조 확인, 인터페이스 식별에 사용합니다.
- 카테고리: NIC Information
- 기본 수집 주기: 60초
- 최소 지원 에이전트: Linux 2.9.18+, Windows 2.9.18+, AIX 1.4.9+, Solaris 1.4.9+, HP-UX 1.4.9+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
nicName | NIC Name | string | 운영체제가 인식하는 네트워크 인터페이스 이름으로, 일반 물리 NIC뿐 아니라 alias 인터페이스, bond/team/bridge, EtherChannel, APA, AGGR, IPMP 등의 논리 인터페이스 및 그 소속 멤버 NIC가 함께 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
ipAddress | IP Address | string | 해당 NIC에 설정된 IPv4 주소이며, 여러 주소가 있을 경우 콤마(,)로 함께 표시될 수 있고 IP가 없으면 none으로 표시될 수 있습니 다. | HP-UX, AIX, Solaris, Linux, Windows |
macAddress | MAC Address | string | 해당 NIC에 할당된 MAC 주소이며, 논리/집성 인터페이스는 운영체제가 보고하는 대표 MAC이 표시될 수 있고 확인 불가 시 none으로 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
link | Link | string | 운영체제 또는 드라이버가 판단한 링크 연결 여부를 나타내며, yes는 연결 상태, no는 미연결 또는 비활성 상태를 의미하고 실제 케이블 상태와 완전히 일치하지 않을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
state | State | string | 해당 NIC의 현재 인터페이스 상태를 나타내며, UP은 사용 가능, DOWN은 비활성 또는 사용 불가, Unknown/Unknown!은 상태 확인 불가를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
duplex | Duplex | string | NIC의 Duplex 모드를 나타내며, Full은 전이중, Half는 반이중, unknown은 운영체제·드라이버·장치 특성상 확인할 수 없는 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
speed | Speed | string | 해당 NIC의 현재 링크 속도 또는 운영체제가 보고한 동작 속도이며, 최대 지원 속도가 아니라 현재 협상되거나 인식된 속도를 의미하고 일부 집성 인터페이스는 합산값으로 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
mode | Mode | string | NIC의 집성, 이중화 또는 팀 구성 방식에 대한 추가 정보를 나타내며, 예를 들어 AIX의 EtherChannel:<mode>, HP-UX의 APA, Windows의 Teaming Mode/Load Balancing, Solaris의 AGGR 또는 IPMP가 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
windowsDriver | Windows Driver | string | Windows 환경에서 해당 NIC가 사용하는 드라이버 또는 어댑터 설명 정보입니다. | Windows |
이중화 구성 표시 방식
nicName과 mode 필드는 이중화 구성에 따라 다음과 같이 표시합니다.
| Item | Description |
|---|---|
| Linux bonding | 본딩에 속한 멤버 인터페이스는 bond0_eth1 형태로 본딩이름_멤버이름 으로 표시하고, mode에는 해당 본딩의 모드를 표시 |
| Windows 팀 인터페이스 | mode에 LBFO/<팀 모드>/<부하 분산 방식> 형태로 표시(예: LBFO/SwitchIndependent/TransportPorts) |
| Windows 팀 멤버 NIC | mode에 LBFO_MEMBER/<설정 역할>/<동작 상태> 형태로 표시(예: LBFO_MEMBER/Active/Active) |
Windows 팀 멤버 NIC는 자체 IP가 없는 숨김 어댑터라 이전에는 목록에 나타나지 않았으나, 현재는 멤버 NIC도 함께 수집합니다. Linux에서는 본딩 드라이버의 제어용 항목(bonding_masters)을 네트워크 인터페이스로 잘못 표시하던 문제를 수정했습니다.
infra_process_group
서버에서 제외 없이 수집한 전체 프로세스 를 대상으로, 기본적으로 실행 argument 는 다르더라도 같은 User 에 의해 같은 cmd 로 실행된 프로세스들을 그룹화하여 자원 사용 현황을 제공하는 카테고리입니다. 그룹 단위로 CPU, 메모리, I/O, page fault 등의 사용량을 합산하여 표시하므로, 사용자는 동일한 프로그램 계열이 서버 자원에 미치는 영향을 한눈에 파악할 수 있습니다. 또한 사용자 정의 process group 관리 기능을 통해 특정 서버/owner/argsPattern 조건으로 그룹을 직접 정의하고, 사용자 지정 process group name으로 관리가 가능합니다.
- 카테고리: ProcessGroup
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
cmd | Command | string | Process Group에 속한 프로세스들의 실행 명령어(cmd)입니다. | HP-UX, AIX, Solaris, Linux, Windows |
name | Name | string | 기본은 cmd 를 표시하지만 사용자가 프로세스 그룹 관리 메뉴를 통해서 정의한 Process Group 인 경우에는 정의한 Process Group 의 이름을 표시합니다. | HP-UX, AIX, Solaris, Linux, Windows |
owner | Owner | string | Process Group에 속한 프로세스들의 실행 계정(user)입니다. 동일 user 기준으로 그룹핑하므로, 그룹 내 프로세스는 동일 owner를 가집니다. | HP-UX, AIX, Solaris, Linux, Windows |
pidList | Process ID List | string | Process TopN에서 수집된 PID만 목록으로 제공합니다. 따라서 표시되는 PID 개수는 Process Count와 다를 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
custom | Custom | string | 사용자가 정의한 프로세스 그룹 여부를 True/False로 표시합니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpu | CPU | % | Process Group에 속한 프로세스들이 사용한 전체 CPU 사용률을 의미합니다. user mode와 system mode 사용률을 포함한 값이며, 시간에 따른 지속 증가, 장시간 고사용률 유지, 주기적 급등 패턴을 함께 보면 해당 그룹의 연산 부하 특성이나 비정상 CPU 점유 여부를 해석하는 데 유용합니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpuUser | CPU User | % | Process Group에 속한 프로세스들이 user mode에서 사용한 CPU 사용률을 의미합니다. 애플리케이션 로직 수행에 사용된 CPU 비중을 보기 위한 지표입니다. 현재 값뿐 아니라 시간에 따른 지속 증가, 반복적인 급등 패턴, procCnt/threadCnt 변화와의 연관성을 함께 보면 업무 처리량 증가에 따른 정상 부하인지, 사용자 영역 연산이 과도한 상황인지를 해석하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpuSys | CPU System | % | Process Group에 속한 프로세스들이 kernel/system mode에서 사용한 CPU 사용률을 의미합니다. 시스템 콜, I/O 처리, 커널 자원 사용과 연관된 CPU 비중을 해석하는 데 활용됩니다. 값이 지속적으로 높거나 user mode 대비 system mode 비중이 과도하게 큰 패턴은 I/O 처리 증가, 커널 호출 증가, 락 경합 등의 영향을 의심하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
rss | RSS | byte | Process Group에 속한 프로세스들의 RSS(Resident Set Size) 합계입니다. 실제 물리 메모리에 적재된 메모리 크기를 의미합니다. 이 값에는 공유 메모리가 포함될 수 있으므로, 공유 메모리를 많이 사용하는 프로세스들이 많은 서버의 경우 프로세스들의 RSS 합은 전체 메모리 크기를 초과할 수도 있습니다. 현재 점유 규모뿐 아니라 시간에 따른 지속 증가 여부, 급격한 증감 패턴을 함께 보면 메모리 누수 또는 비정상 점유 여부를 판단하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux |
pRss | RSS | % | Process Group의 RSS 합계가 시스템 전체 물리 메모리에서 차지하는 비율을 의미합니다. rss / 전체 물리 메모리 * 100으로 계산합니다. 프로세스 그룹의 RSS 합계는 공유 메모리를 중복 포함할 수 있으므로, 시스템 전체 물리 메모리 대비 100%를 초과해 보일 수 있습니다. 절대 사용률뿐 아니라 장시간에 걸친 상승 추이와 고점 유지 여부를 함께 보면 해당 프로세스 그룹의 메모리 압박 영향도를 판단하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux |
vsz | VSZ | byte | Process Group에 속한 프로세스들이 확보한 전체 가상 메모리 주소공간 크기의 합계입니다. 실제 물리 메모리 사용량이 아니라 할당되었거나 예약된 주소 공간 크기를 의미하며, 파일 매핑, shared library, swap 예약 등이 포함될 수 있습니다. 따라서 현재 값 자체보다 장기적인 증가 추이, 다른 실제 메모리 지표(RSS/PSS/USS)와의 차이를 함께 보는 것이 중요합니다. | HP-UX, AIX, Solaris, Linux, Windows |
pss | PSS | byte | Linux에서 Process Group에 속한 프로세스들의 PSS(Proportional Set Size) 합계입니다. 공유 메모리를 공유한 프로세스 수만큼 나누어 반영한 비중 기준의 물리 메모리 사용량으로, RSS보다 실제 점유 수준에 가까운 메모리 부담을 파악하는 데 유용합니다. Process Group 전체의 공유 메모리 포함 사용 경향과 시간에 따른 증가 추이를 함께 보면 메모리 사용 구조 변화를 해석하는 데 도움이 됩니다. Linux에서는 수집 비용을 고려하여 각 PID의 /proc/[pid]/smaps_rollup 파일이 제공되는 경우에만 수집·합산하며, Agent 2.9.20 이상부터는 RSS가 일정 크기(기본 4GiB)를 초과하는 프로세스는 PSS 계산 과정에서 대상 프로세스에 부하가 발생할 수 있으므로 에이전트가 기본적으로 PSS 수집을 생략하며 값은 비어 있을 수 있습니다. 따라서 여러 프로세스를 하나의 그룹으로 집계하는 경우, PSS가 수집되지 않은 프로세스는 그룹 합계에서 제외되므로 그룹의 총 PSS는 실제 메모리 사용량보다 작게 표시될 수 있습니다. 임계치는 설정을 통해 변경할 수 있습니다. | Linux: smaps_rollup 지원 환경 |
uss | USS | byte | Linux에서 Process Group에 속한 프로세스들의 USS(Unique Set Size) 합계입니다. 각 프로세스가 단독으로 사용하는 비공유 물리 메모리 사용량의 합으로, Process Group 종료 시 실제로 반환될 가능성이 높은 메모리 규모를 파악하는 데 유용합니다. 공유 메모리를 제외한 순수 점유 메모리의 증가 추이를 보면 특정 서비스 그룹 자체의 메모리 누수 가능성을 판단하는 데 도움이 됩니다. Linux에서는 수집 비용을 고려하여 각 PID의 /proc/[pid]/smaps_rollup 파일이 제공되는 경우에만 수집·합산하며, Agent 2.9.20 이상부터는 RSS가 일정 크기(기본 4GiB)를 초과하는 프로세스는 USS 계산 과정에서 대상 프로세스에 부하가 발생할 수 있으므로 에이전트가 기본적으로 USS 수집을 생략하며 값은 비어 있을 수 있습니다. 따라서 여러 프로세스를 하나의 그룹으로 집계하는 경우, USS가 수집되지 않은 프로세스는 그룹 합계에서 제외되므로 그룹의 총 USS는 실제 메모리 사용량보다 작게 표시될 수 있습니다. 임계치는 설정을 통해 변경할 수 있습니다. | Linux: smaps_rollup 지원 환경 |
minFlt | Page Minor Fault | counts/s | Process Group에 속한 프로세스들의 초당 minor page fault 수 합계입니다. Page fault가 발생했지만 디스크 I/O 없이 메모리 내부에서 해결된 fault를 의미합니다. 값 자체도 의미가 있지만, RSS 증가나 작업량 증가와 함께 완만하게 상승하는 패턴은 정상적인 메모리 접근 확대일 수 있으며, 갑작스러운 급증은 접근 패턴 변화나 메모리 재활용 증가를 시사할 수 있습니다. | Linux |
majFlt | Page Major Fault | counts/s | Process Group에 속한 프로세스들의 초당 major page fault 수 합계입니다. 필요한 페이지를 디스크/스왑 영역에서 실제 읽어와야 했던 fault를 의미합니다. 일반적으로 file-backed page 또는 swap 영역에서 읽기가 포함됩니다. 값이 지속적으로 높거나 증가 추이를 보이면 메모리 압박, page-in 증가, 응답 지연 가능성을 해석하는 데 중요한 지표가 됩니다. | Linux |
workingSet | Working Set | byte | Windows 전용 지표로, Process Group에 속한 프로세스들의 Working Set 합계입니다. 현재 물리 메모리에 상주 중인 메모리 크기를 나타냅니다. 순간 값도 중요하지만, 장시간 증가 추이, 급격한 팽창 후 회복 여부를 함께 보면 메모리 압박 또 는 비정상 점유 패턴을 파악하는 데 도움이 됩니다. | Windows |
private | Private | byte | Windows 전용 지표로, Process Group에 속한 프로세스들이 독점적으로 사용하는 private memory 합계입니다. 공유되지 않는 전용 메모리 사용량을 의미하며, 프로세스 고유의 메모리 증가를 보기 위한 지표입니다. 시간에 따라 지속적으로 증가하고 회수되지 않는 패턴은 메모리 누수 징후 해석에 유용할 수 있습니다. | Windows |
poolPaged | Pool Paged | byte | Windows 전용 지표로, Process Group에 속한 프로세스와 관련된 paged pool 메모리 사용량 합계입니다. 필요 시 디스크로 페이징될 수 있는 커널 메모리 영역을 의미합니다. 현재 값뿐 아니라 장기적인 증가 추이와 회복 여부를 함께 보면 커널 리소스 사용 증가나 비정상 점유 패턴을 파악하는 데 도움이 됩니다. | Windows |
totalCharIo | Process IO Total | bytes/s | Process Group에 속한 프로세스들의 초당 발생시킨 전체 Character 기반 I/O(char I/O) 처리량 합계입니다. 디스크뿐 아니라 파이프, 터미널, 캐시, 일부 버퍼 기반 I/O까지 포함될 수 있으므로 실제 물리 디스크 I/O와는 차이가 있을 수 있습니다. 현재 처리량도 중요하지만, 시간에 따른 지속 증가, 급증 구간, 반복적인 작업 패턴을 함께 보면 해당 그룹의 전체 I/O 활동 특성을 해석하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
rcharIo | Read Character IO | bytes/s | Process Group에 속한 프로세스들의 초당 발생시킨 read char I/O 처리량 합계입니다. 디스크 read뿐 아니라 버퍼, 캐시, 터미널 등을 통한 읽기 요청이 포함될 수 있습니다. 따라서 순간값뿐 아니라 작업 주기와 연관된 반복 패턴, 급증 시점, CPU 및 Disk I/O 지표와의 관계를 함께 보는 것이 중요합니다. | Linux, Windows |
wcharIo | Write Character IO | bytes/s | Process Group에 속한 프로세스들의 초당 발생시킨 write char I/O 처리량 합계입니다. 디스크 write뿐 아니라 버퍼, 캐시, 터미널 등을 통한 쓰기 요청이 포함될 수 있습니다. 값의 지속 증가나 반복적인 급증 패턴은 로그 출력 증가, 버퍼 flush, 데이터 처리 작업과의 연관성을 해석하는 데 도움이 됩니다. | Linux, Windows |
rdiskIo | Read Disk IO | bytes/s | Linux 전용 지표로, Process Group에 속한 프로세스들이 초당 디스크에서 실제로 발생시킨 읽기 I/O 처리량의 합계입니다. 파일시스템 캐시에서 처리된 읽기는 제외되므로, rcharIo 보다 실제 스토리지 장치 read에 가까운 값입니다. 따라서 캐시 hit가 많은 환경에서는 rcharIo 는 높아도 rdiskIo 는 낮을 수 있으며, 실제 디스크 의존적인 read 부하를 파악하기 위한 지표로 해석하는 것이 적절합니다. | Linux |
wdiskIo | Write Disk IO | bytes/s | Linux 전용 지표로, Process Group에 속한 프로세스들이 초당 디스크에 실제로 발생시킨 쓰기 I/O 처리량 합계입니다. 이 값은 프로세스가 발생시킨 전체 쓰기 요청량(wcharIo)과는 다를 수 있으며, 페이지 캐시/버퍼 캐시 및 writeback 동작의 영향으로 시간차를 두고 반영될 수 있습니다. 따라서 실제 스토리지에 기록되는 write 부하를 보기 위한 지표로 해석하는 것이 적절합니다. | Linux |
threadCnt | Thread | count | 현재 해당 Process Group에 속한 전체 thread 수를 의미합니다. 그룹 내 모든 프로세스의 thread 개수를 합산한 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
procCnt | Process | count | 현재 해당 Process Group에 속한 전체 process 수를 의미합니다. 동일 user가 동일 command로 실행한 프로세스 개수로 해석할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
fdCnt | File Descriptor | count | Linux 전용 지표로, Process Group에 속한 프로세스들이 현재 열고 있는 file descriptor 수의 합계입니다. 파일, 소켓, 파이프, 디바이스 등에 대한 열린 fd가 포함됩니다. | Linux |
handleCnt | Handle | count | Windows 전용 지표로, Process Group에 속한 프로세스들이 현재 가지고 있는 Handle 수의 합계입니다. 파일, 프로세스, 스레드, 이벤트, 레지스트리 키 등 다양한 커널 객체에 대한 참조를 포함합니다. | Windows |
infra_process_topn
수집 시점에 서버에서 자원 사용률이 높은 개별 프로세스만 선별하여 저장하는 카테고리입니다. 기본적으로 개별 프로세스별 CPU 사용률이 0.1% 이상인 프로세스 중 상위 30개를 우선 수집하며, 이 조건과 별개로 CPU 사용률이 0이더라도 RSS 20MB 이상인 프로세스 중 상위 10개까지 추가 수집하여, 최대 40개 수준의 프로세스를 저장합니다. 사용자는 이 카테고리를 통해 실제로 어떤 PID가 CPU 또는 메모리를 많이 사용하고 있는지 상세 분석 관점에서 확인할 수 있습니다. 즉, Process Group 이 자원 사용의 큰 흐름을 보는 용도라면, Process TopN은 원인이 되는 개별 프로세스를 구체적으로 추적하는 용도로 사용합니다.
- 카테고리: ProcessTopN
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
cmd | Command | string | 프로세스의 실행 command만 추출한 값을 의미합니다. cmdline 또는 실행 파일명 기준으로 파싱하여 사용합니다. | HP-UX, AIX, Solaris, Linux, Windows |
owner | Owner | string | 해당 프로세스를 실행한 사용자 계정(user)을 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
args | Arguments | string | 해당 프로세스의 실행 arguments(명령행 인자)를 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
stime | StartTime | string | 해당 프로세스의 시작 시각을 epoch time 기준으로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
pid | PID | string | 해당 프로세스의 PID(Process ID)를 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
ppid | PPID | string | 해당 프로세스의 PPID(Parent Process ID)를 나타내는 값입니다. 즉, 이 프로세스를 생성한 부모 프로세스 의 PID입니다. | HP-UX, AIX, Solaris, Linux, Windows |
procInfo | Process Information | string | 프로세스 식별 및 표시를 위해 사용하는 정보성 필드입니다. owner, pid, ppid, stime, cmd(args) 등의 조합으로 구성됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpu | CPU | % | 해당 프로세스가 사용한 전체 CPU 사용률을 의미합니다. user mode와 system mode 사용률을 포함한 값이며, 멀티코어 환경에서는 전체 논리 코어 수를 기준으로 보정하여 최대 100% 범위로 표시합니다. 즉 시스템 전체 CPU 자원 대비 이 프로세스가 차지하는 사용 비율로 해석할 수 있습니다. 순간 사용률도 중요하지만, 지속적인 고사용률 유지 여부나 주기적 급등 패턴을 함께 보면 CPU 자원 점유 특성을 해석하는 데 유용합니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpuUser | CPU User | % | 해당 프로세스가 user mode에서 사용한 CPU 사용률을 의미합니다. 애플리케이션 로직 수행에 사용된 CPU 비중을 보기 위한 지표이며, 시간에 따른 지속 증가나 반복적인 급등 패턴을 함께 보면 사용자 영역 연산 부하 특성을 파악하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
cpuSys | CPU System | % | 해당 프로세스가 kernel/system mode에서 사용한 CPU 사용률을 의미합니다. 시스템 콜, I/O 처리, 커널 자원 사용과 연관된 CPU 비중을 해석하는 데 활용됩니다. 값이 지속적으로 높거나 user 대비 system 비중이 과도하게 큰 패턴은 커널 호출, I/O, 락 경합 등의 영향을 의심하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
rss | RSS | byte | 해당 프로세스의 RSS(Resident Set Size)값이며 현재 실제 물리 메모리에 적재된 메모리 크기를 의미합니다. 이 값에는 공유 메모리가 포함되므로 공유 메모리를 많이 사용하는 프로세스들이 많은 서버의 경우 프로세스들의 RSS 합은 전체 메모리 크기를 초과할 수도 있습니다. 현재 점유 규모를 보여주는 대표 지표이며, 시간에 따라 지속적으로 증가하는 경우 메모리 누수 또는 비정상 점유 가능성을 판단하는 데 유용합니다. | HP-UX, AIX, Solaris, Linux |
pRss | RSS | % | 해당 프로세스의 RSS가 시스템 전체 물리 메모리에서 차지하는 비율을 의미합니다. 절대값 자체보다 장시간에 걸친 상승 추이와 고점 유지 여부를 함께 보면 특정 프로세스가 시스템 메모리 압박에 얼마나 영향을 주는지 해석하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux |
vsz | VSZ | byte | 해당 프로세스가 확보한 전체 가상 메모리 주소공간 크기를 의미합니다. 실제 물리 메모리 사용량이 아니라, 매핑되었거나 예약된 가상 주소공간 기준의 크기입니다. 따라서 값 자체보다 RSS/PSS/USS와의 차이, 그리고 장기적인 증가 추이를 함께 보는 것이 중요합니다. VSZ만 크고 실제 점유 메모리가 크지 않은 경우도 있을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
pss | PSS | byte | 해당 프로세스의 PSS(Proportional Set Size) 값입니다. 공유 메모리를 공유한 프로세스 수만큼 나누어 반영한 비중 기준의 물리 메모리 크기를 의미하며, RSS보다 실제 점유 수준에 가까운 메모리 사용량을 파악하는 데 유용합니다. 공유 라이브러리나 공용 메모리 사용이 많은 환경에서 프로세스별 메모리 부담을 비교할 때 특히 유용합니다. Linux에서는 수집 비용을 고려하여 /proc/[pid]/smaps_rollup 파일이 제공되는 환경에서만 수집하며, Agent 2.9.20 이상부터는 RSS가 일정 크기(기본 4GiB)를 초과하는 프로세스는 PSS 계산 과정에서 대상 프로세스에 부하가 발생할 수 있으므로, 에이전트가 기본적으로 PSS 수집을 생략하며 값은 비어 있을 수 있습니다. 임계치는 설정을 통해 변경할 수 있습니다. | Linux: smaps_rollup 지원 환경 |
uss | USS | byte | 해당 프로세스의 USS(Unique Set Size) 값입니다. 이 프로세스만 단독으로 사용하는 비공유 물리 메모리 크기를 의미하며, 프로세스 종료 시 실제로 반환될 가능성이 높은 메모리 규모를 파악하는 데 유용합니다. 공유 메모리를 제외한 순수 점유 메모리를 보기 위한 지표로, 시간에 따라 지속적으로 증가하고 회수되지 않는 패턴은 해당 프로세스 자체의 메모리 누수 가능성을 판단하는 데 특히 유용합니다. Linux에서는 수집 비용을 고려하여 /proc/[pid]/smaps_rollup 파일이 제공되는 환경에서만 수집하며, Agent 2.9.20 이상부터는 RSS가 일정 크기(기본 4GiB)를 초과하는 프로세스는 USS 계산 과정에서 대상 프로세스에 부하가 발생할 수 있으므로, 에이전트가 기본적으로 USS 수집을 생략하며 값은 비어 있을 수 있습니다. 임계치는 설정을 통해 변경할 수 있습니다. | Linux: smaps_rollup 지원 환경 |
minFlt | Page Minor Fault | counts/s | 해당 프로세스의 초당 minor page fault 수를 의미합니다. 페이지 fault가 발 생했지만 디스크 I/O 없이 메모리 내부에서 해결된 fault입니다. 값 자체도 의미가 있지만, RSS 증가나 작업량 증가와 함께 완만하게 상승하는 패턴은 정상적인 메모리 접근 확대일 수 있으며, 갑작스러운 급증은 접근 패턴 변화나 메모리 재활용 증가를 시사할 수 있습니다. | Linux |
majFlt | Page Major Fault | counts/s | 해당 프로세스의 초당 major page fault 수를 의미합니다. 필요한 페이지를 디스크/스왑 영역에서 실제 읽어와야 했던 fault를 나타냅니다. 일반적으로 file-backed page 또는 swap 영역에서 읽기가 포함될 수 있습니다. 값이 지속적으로 높거나 증가 추이를 보이면 메모리 압박, page-in 증가, 응답 지연 가능성을 해석하는 데 중요한 지표가 됩니다. | Linux |
workingSet | Working Set | byte | Windows 전용 지표로, 현재 해당 프로세스가 물리 메모리에 상주시켜 사용 중인 메모리 크기를 의미합니다. 프로세스의 실제 메모리 사용량을 보는 대표 지표로 활용됩니다. 현재 값도 중요하지만, 장시간 증가 추이, 급격한 팽창 후 회복 여부를 함께 보면 메모리 압박 또는 비정상 점유 패턴을 파악하는 데 도움이 됩니다. | Windows |
private | Private | byte | Windows 전용 지표로, 해당 프로세스가 독점적으로 사용하는 private memory 크기를 의미합니다. 다른 프로세스와 공유하지 않는 전용 메모리 사용량을 나타내므로, 프로세스 고유의 메모리 증가를 보기 위한 지표입니다. 시간에 따라 지속적으로 증가하고 회수되지 않는 패턴은 메모리 누수 징후 해석에 유용할 수 있습니다. | Windows |
poolPaged | Pool Paged | byte | Windows 전용 지표로, 해당 프로세스와 관련된 paged pool 메모리 사용량을 의미합니다. 필요 시 디스크로 페이징될 수 있는 커널 메모리 영역과 연관된 사용량입니다. 현재 값뿐 아니라 장기적인 증가 추이와 회복 여부를 함께 보면 커널 리소스 증가나 비정상적인 메모리 사용 패턴을 파악하는 데 도움이 됩니다. | Windows |
totalCharIo | Process IO Total | bytes/s | 해당 프로세스가 초당 발생시킨 전체 character 기반 I/O(char I/O) 처리량을 의미합니다. 디스크뿐 아니라 파이프, 터미널, 버퍼, 캐시, 파일 시스템 레이어를 통한 I/O까지 포함될 수 있으므로 실제 물리 디스크 I/O와는 차이가 있을 수 있습니다. 현재 처리량뿐 아니라 시간에 따른 급증 구간, 지속적인 고사용 패턴을 함께 보면 프로세스의 I/O 활동 특성을 해석하는 데 도움이 됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
rcharIo | Read Character IO | bytes/s | 해당 프로세스가 초당 발생시킨 read char I/O 처리량을 의미합니다. 디스크 read뿐 아니라 버퍼, 캐시, 터미널 등을 통한 읽기 요청이 포함될 수 있습니다. 따라서 순간값뿐 아니라 작업 주기와 연관된 반복 패턴, 급증 시점을 함께 보는 것이 중요합니다. | Linux, Windows |
wcharIo | Write Character IO | bytes/s | 해당 프로세스가 초당 발생시킨 write char I/O 처리량을 의미합니다. 디스크 write뿐 아니라 버퍼, 캐시, 터미널 등을 통한 쓰기 요청이 포함될 수 있습니다. 값의 지속 증가나 반복적인 급증 패턴은 로그 출력, 버퍼 flush, 데이터 처리 작업과의 연관성을 해석하는 데 도움이 됩니다. | Linux, Windows |
rdiskIo | Read Disk IO | bytes/s | Linux 전용 지표로, 해당 프로세스가 초당 디스크에서 실제로 발생시킨 읽기 I/O 처리량의 합계입니다. 파일시스템 캐시에서 처리된 읽기는 제외되므로, rcharIo 보다 실제 스토리지 장치 read에 가까운 값입니다. 따라서 캐시 hit가 많은 환경에서는 rcharIo 는 높아도 rdiskIo 는 낮을 수 있으며, 실제 디스크 의존적인 read 부하를 파악하기 위한 지표로 해석하는 것이 적절합니다. | Linux |
wdiskIo | Write Disk IO | bytes/s | Linux 전용 지표로, 해당 프로세스가 초당 디스크에 실제로 발생시킨 쓰기 I/O 처리량 합계입니다. 이 값은 프로세스가 발생시킨 전체 쓰기 요청량(wcharIo)과는 다를 수 있으며, 페이지 캐시/버퍼 캐시 및 writeback 동작의 영향으로 시간차를 두고 반영될 수 있습니다. 따라서 실제 스토리지에 기록되는 write 부하를 보기 위한 지표로 해석하는 것이 적절합니다. | Linux |
threadCnt | Thread | count | 해당 프로세스가 현재 보유하고 있는 thread 수를 의미합니다. 멀티스레드 애플리케이션의 동시성 수준을 파악하는 데 유용합니다. | HP-UX, AIX, Solaris, Linux, Windows |
fdCnt | File Descriptor | count | Linux 전용 지표로, 해당 프로세스가 현재 열고 있는 file descriptor 수를 의미합니다. 파일, 소켓, 파이프, 디바이스 등에 대한 열린 FD가 포함됩니다. | Linux |
handleCnt | Handle | count | Windows 전 용 지표로, 해당 프로세스가 현재 보유하고 있는 Handle 수를 의미합니다. 파일, 프로세스, 스레드, 이벤트, 레지스트리 키 등 다양한 커널 객체에 대한 참조를 포함합니다. | Windows |
쿠버네티스 메타데이터 필드
컨테이너 런타임이 동작하는 Linux 서버에서는 프로세스가 속한 파드 정보를 함께 수집합니다. 서버에서 자원을 많이 쓰는 프로세스를 찾은 뒤, 그 프로세스가 어느 파드의 어느 컨테이너인지 바로 확인할 수 있습니다.
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
namespace | Namespace | string | 프로세스가 속한 컨테이너의 쿠버네티스 네임스페이스. 컨테이너 프로세스가 아니면 빈 값 | Linux |
podName | Pod Name | string | 프로세스가 속한 파드 이름 | Linux |
containerName | Container Name | string | 프로세스가 속한 컨테이너 이름 | Linux |
세 필드는 기본으로 수집하며, process.topn.k8s.enabled=false로 설정하면 수집을 중단하고 세 필드를 전송하지 않습니다. 컨테이너 런타임이 없는 서버에서는 값이 비어 있습니다.
지원 에이전트 버전은 Linux 2.9.23 이상입니다.
infra_win_service
Windows 서비스 단위 상태 정보를 수집하는 카테고리입니다. 서비스 이름, PID, state, status, start mode, exit code 등을 제공합니다. Windows 서비스의 실행 상태, 기동 설정, 비정상 종료 여부를 확인할 때 사용합니다.
- 카테고리: Windows Service
- 기본 수집 주기: 60초
- 최소 지원 에이전트: Windows 2.9.19+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
svcName | Service Name | string | Windows 서비스의 고유 서비스 이름을 나타내는 값입니다. 서비스 관리 도구(services.msc)의 내부 식별자 또는 시스템 서비스 이름과 대응되며, 표시 이름(Display Name)과는 다를 수 있습니다. | Windows |
pid | PID | string | 현재 해당 서비스를 실행 중인 프로세스의 PID(Process ID)를 나타내는 값입니다. 서비스가 실행 중이 아닌 경우 비어 있거나 0으로 표시될 수 있습니다. svchost.exe처럼 하나의 프로세스에서 여러 서비스가 함께 동작하는 경우 동일한 PID를 공유할 수 있습니다. | Windows |
state | State | string | 서비스 제어 관리자(SCM) 기준의 현재 서비스 상태를 나타내는 값입니다. 예를 들어 Running, Stopped, Start Pending, Stop Pending, Paused, Pause Pending, Continue Pending 등의 상태가 표시될 수 있습니다. | Windows |
startMode | Start Mode | string | 시스템 부팅 또는 서비스 시작 시 이 서비스가 어떤 방식으로 시작되도록 설정되어 있는지를 나타내는 값입니다. Automatic, Manual, Disabled가 표시되며, 환경에 따라 Automatic (Delayed Start)가 구분되어 표시될 수 있습니다. | Windows |
exitCode | Exit Code | string | 서비스가 마지막으로 종료되거나 시작/중지 작업을 수행하는 과정에서 반환한 종료 코드를 나타내는 값입니다. 일반적으로 0은 정상 종료 또는 오류 없음으로 해석하며, 0이 아닌 값은 서비스 시작 실패, 실행 오류, 비정상 종료 등의 원인을 추적할 때 참고할 수 있습니다. | Windows |
infra_nic_perf
개별 NIC 단위의 성능 지표를 수집하는 카테고리입니다. 인터페이스별 송수신 대역폭, 패킷 수, error, drop, collision 등을 제공합니다. 특정 NIC의 병목, packet loss, 인터럽트/오류 편중 여부를 확인할 때 사용합니다.
- 카테고리: by NIC
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
name | NIC Name | string | 네트워크 인터페이스의 이름을 나타내는 값입니다. 예를 들어 Linux의 eth0, ens192, bond0, Windows의 어댑터 이름 등이 표시됩니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalbps | NIC Total | bps | 해당 NIC를 통해 초당 송신(Tx)과 수신(Rx)된 전체 데이터 전송량의 합을 bps(bit per second) 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
rxbps | NIC RX | bps | 해당 NIC를 통해 초당 수신(Rx)된 데이터 전송량을 bps(bit per second) 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
txbps | NIC Tx | bps | 해당 NIC를 통해 초당 송신(Tx)된 데이터 전송량을 bps(bit per second) 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalpps | NIC Total PPS | counts/s | 해당 NIC를 통해 초당 수신(Rx) 및 송신(Tx)된 전체 패킷 수의 합을 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. rxpps + txpps에 해당합니다. | HP-UX, AIX, Solaris, Linux, Windows |
rxpps | NIC Rx PPS | counts/s | 해당 NIC를 통해 초당 수신(Rx)된 패킷 수를 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
txpps | NIC Tx PPS | counts/s | 해당 NIC를 통해 초당 송신(Tx)된 패킷 수를 pps(packets per second) 또는 count/s 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
collision | NIC Collision | counts/s | 해당 NIC의 송신(Tx) 과정에서 감지된 패킷 충돌 수를 초당 평균 변화율(rate)로 환산한 값입니다. 주로 half-duplex Ethernet 환경에서 의미가 있으며, modern full-duplex 환경에서는 일반적으로 0에 가까운 것이 정상입니다. | HP-UX, AIX, Solaris, Linux |
errIn | NIC Error In | counts/s | 해당 NIC를 통해 수신(Rx)된 패킷 중 오류가 발생한 패킷 수를 초당 평균 변화율(rate)로 환산한 값입니다. CRC 오류, frame 오류, overrun 등 수신 오류를 포함할 수 있으며, 포함 범위는 OS/드라이버에 따라 다를 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
errOut | NIC Error Out | counts/s | 해당 NIC를 통해 송신(Tx)된 패킷 중 오류가 발생한 패킷 수를 초당 평균 변화율(rate)로 환산한 값입니다. carrier 오류, abort, transmit queue 문제 등 송신 오류를 포함할 수 있으며, 포함 범위는 OS/드라이버에 따라 다를 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
dropIn | NIC Drop In | counts/s | 해당 NIC를 통해 수신(Rx)된 패킷 중 커널 또는 NIC 계층에서 처리되지 못하고 드롭된 패킷 수를 초당 평균 변화율(rate)로 환산한 값입니다. 버퍼 부족, queue overflow, 드라이버 처리 지연 등으로 증가할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
dropOut | NIC Drop Out | counts/s | 해당 NIC를 통해 송신(Tx)된 패킷 중 실제 전송 전에 드롭된 패킷 수를 초당 평균 변화율(rate)로 환산한 값입니다. 송신 queue overflow, 드라이버 문제, 인터페이스 상태 이상 등으로 증가할 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
linkSpeed | NIC Link Speed | bps | 해당 NIC의 링크 속도를 Mbps 단위로 나타낸 값입니다. 실제 사용량이 아니라 현재 협상되거나 설정된 인터페이스의 전송 대역폭 용량을 의미합니다. 다만 OS/드라이버/가상 인터페이스 유형에 따라 링크 속도를 확인할 수 없는 경우에는 unknown 또는 null 로 수집될 수 있으며, 이 경우 값이 출력되지 않을 수 있습니다 | HP-UX, AIX, Solaris, Linux, Windows |
linkUsage | NIC Utilization | % | 해당 NIC의 전체 송수신 처리량(NIC Total)을 링크 속도(NIC Link Speed) 대비 백분율로 환산한 값입니다. NIC의 사용 가능한 링크 대역폭 대비 실제 트래픽 사용 수준을 나타내며, 값이 높을수록 링크가 바쁘게 사용되고 있음을 의미합니다. 다만 링크 속도(NIC Link Speed)가 unknown 또는 null 인 경우에는 사용률을 계산할 수 없어 값이 출력되지 않을 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
infra_infiniband
InfiniBand 또는 HCA 포트 단위의 상태 및 성능 지표를 수집하는 카테고리입니다. 포트 상태, 링크 계층, 속도, LID, 송수신 처리량, 패킷 수, symbol error, link recovery, constraint error 등을 제공합니다. IB fabric 연결 상태와 링크 품질, 포트별 병목/오류를 확인할 때 사용합니다.
- 카테고리: by Infiniband
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
interfaceName | Interface Name | string | HCA 장치명과 포트 번호를 함께 나타내는 식별값입니다. 예를 들어 mlx5_0:1은 mlx5_0 장치의 1번 포트를 의미합니다. | Linux |
linkLayer | Link Layer | string | 해당 포트의 링크 계층 유형을 나타냅니다. InfiniBand 또는 Ethernet이 표시되며, 포트가 어떤 링크 모드로 동작 중인지 확인할 때 사용합니다. | Linux |
state | State | string | 포트의 논리 상태를 나타냅니다. 예를 들어 Down, Init, Active 등이 표시될 수 있으며, 포트가 IB fabric에 정상적으로 참여 중인지 여부를 판단하는 기준이 됩니다. | Linux |
physState | Physical State | string | 포트의 물리 링크 상태를 나타냅니다. 예를 들어 Polling, LinkUp, Disabled 등이 표시될 수 있으며, 케이블 연결 및 물리 계층 협상 상태를 판단할 때 사용합니다. | Linux |
rate | Link Speed | string | 포트의 현재 링크 속도를 나타냅니다. 예를 들어 100Gb/s, 200Gb/s 등이 표시되며, 링크 협상 결과 또는 포트 최대 동작 속도를 확인하는 데 사용합니다 | Linux |
lid | Local Identifier | string | InfiniBand 환경에서 해당 포트에 할당된 LID(Local Identifier)를 나타냅니다. IB fabric 내에서 포트의 논리 주소 역할을 하며, Ethernet 모드에서는 의미가 없거나 비어 있을 수 있습니다. | Linux |
portXmitData | Transmit Data | bytes/s | 해당 포트에서 초당 전송(Tx)된 데이터 처리량을 Bytes/s 단위로 나타낸 값입니다. 포트 기준 송신 사용량을 의미합니다. | Linux |
portRcvData | Receive Data | bytes/s | 해당 포트에서 초당 수신(Rx)된 데이터 처리량을 Bytes/s 단위로 나타낸 값입니다. 포트 기준 수신 사용량을 의미합니다. | Linux |
portXmitPackets | Transmit Packets | counts/s | 해당 포트에서 초당 전송된 전체 패킷 수를 나타낸 값입니다. 패킷 크기와 무관한 packet rate 지표입 니다. | Linux |
portRcvPackets | Receive Packets | counts/s | 해당 포트에서 초당 수신된 전체 패킷 수를 나타낸 값입니다. 패킷 크기와 무관한 packet rate 지표입니다. | Linux |
unicastRcvPackets | Unicast Receive Packets | counts/s | 해당 포트에서 초당 수신된 유니캐스트 패킷 수를 나타낸 값입니다. 단일 대상과의 일반 트래픽 흐름을 확인할 때 유용합니다. | Linux |
unicastXmitPackets | Unicast Transmit Packets | counts/s | 해당 포트에서 초당 전송된 유니캐스트 패킷 수를 나타낸 값입니다. | Linux |
multicastRcvPackets | Multicast Receive Packets | counts/s | 해당 포트에서 초당 수신된 멀티캐스트 패킷 수를 나타낸 값입니다. 멀티캐스트 기반 통신이나 IB fabric 제어 트래픽 영향 분석 시 참고할 수 있습니다. | Linux |
multicastXmitPackets | Multicast Transmit Packets | counts/s | 해당 포트에서 초당 전송된 멀티캐스트 패킷 수를 나타낸 값입니다. | Linux |
symbolError | Symbol Errors | counts/s | 물리 링크 계층에서 발생한 심볼 오류(symbol error)의 초당 변화율을 나타낸 값입니다. 일반적으로 비트 오류, 케이블 품질 문제, 광모듈/포트 불안정 등의 신호일 수 있습니다. | Linux |
portRcvErrors | Port Receive Errors | counts/s | 해당 포트가 수신 과정에서 기록한 전체 오류 카운터의 초당 변화율을 나타낸 값입니다. 수신 프 레임 이상, 무결성 문제, 프로토콜 오류 등이 포함될 수 있습니다. | Linux |
portRcvRemotePhysicalErrors | Remote Physical Errors | counts/s | 상대편 포트에서 발생한 물리 계층 문제로 인해 이 포트가 수신한 오류 카운터의 초당 변화율을 나타낸 값입니다. 원격 포트 또는 링크 반대편 케이블/모듈 상태 이상을 의심할 수 있습니다. | Linux |
portRcvSwitchRelayErrors | Switch Relay Errors | counts/s | 스위치가 패킷을 올바르게 중계(relay)하지 못했을 때 기록되는 오류 카운터의 초당 변화율을 나타낸 값입니다. 스위치 전달 경로 문제 또는 fabric 이상 상황을 시사할 수 있습니다. | Linux |
linkErrorRecovery | Link Error Recovery | counts/s | 링크 오류 복구(link error recovery) 이벤트의 초당 변화율을 나타낸 값입니다. 링크 재초기화 또는 오류 회복이 빈번하게 일어나고 있음을 의미할 수 있습니다. 값이 지속적으로 증가하면 링크 불안정을 의심할 수 있습니다. | Linux |
portXmitConstraintErrors | Transmit Constraint Errors | counts/s | 전송 측 제약 조건 위반으로 기록된 오류의 초당 변화율을 나타낸 값입니다. 예를 들어 SL, VL, QoS, partition key 등의 fabric 정책 불일치가 원인이 될 수 있습니다. | Linux |
portRcvConstraintErrors | Receive Constraint Errors | counts/s | 수신 측 제약 조건 위반으로 기록된 오류의 초당 변화율을 나타낸 값입니다. 전송 측과 수신 측의 fabric 정책, partition, QoS 불일치가 있는 경우 증가할 수 있습니다. | Linux |
localLinkIntegrityErrors | Local Link Integrity Errors | counts/s | 로컬 포트 기준 링크 무결성 오류의 초당 변화율을 나타낸 값입니다. CRC/비트 오류, 신호 품질 저하, 케이블 또는 포트 하드웨어 이상과 연관될 수 있습니다. | Linux |
excessiveBufferOverrunErrors | Buffer Overrun Errors | counts/s | 수신 버퍼 오버런으로 인해 정상 처리하지 못한 오류의 초당 변화율을 나타낸 값입니다. 포트 처리 능력 대비 burst 트래픽이 크거나, 시스템/드라이버/펌웨어 처리 지연이 있을 때 증가할 수 있습니다. | Linux |
linkDowned | Link Down Events | counts/s | 링크가 Down 상태로 전환된 이벤트의 초당 변화율을 나타낸 값입니다. 케이블 탈착, 상대 포트 비활성화, 링크 불안정, 장비 재초기화 등의 상황에서 증가할 수 있습니다. | Linux |
portXmitDiscards | Transmit Discards | counts/s | 전송 큐에서 실제 송신 전에 폐기(discard)된 패킷 수의 초당 변화율을 나타낸 값입니다. 버퍼 부족, 혼잡, 큐 제약, 포트 상태 이상 등이 원인이 될 수 있습니다. | Linux |
vl15Dropped | VL15 Dropped Packets | counts/s | VL15(Subnet Management 전용 Virtual Lane) 큐에서 폐기된 패킷 수의 초당 변화율을 나타낸 값입니다. Subnet Manager 관련 제어 트래픽 혼잡이나 fabric 관리 경로 이상을 시사할 수 있습니다. | Linux |
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
rdmaNetDevice | RDMA Net Device | string | 해당 RDMA 장치·포트에 연결된 운영체제 네트워크 인터페이스 이름. 여러 개면 |로 구분(예: ib0, enp175s0f0). 매핑 정보가 없으면 빈 값 | Linux |
RDMA 포트와 운영체제 네트워크 인터페이스를 연결해 볼 수 있어, InfiniBand 포트의 오류 지표와 해당 인터페이스의 트래픽 지표를 함께 확인할 때 사용합니다. 순수 InfiniBand 포트처럼 포트 단위 매핑을 제공하지 않는 경우에는 장치 단위 매핑을 대신 표시합니다.
지원 에이전트 버전은 Linux 2.9.23 이상입니다.
infra_disk_perf
개별 물리 디스크 단위의 성능 지표를 수집하는 카테고리입니다. 디스크별 처리량, IOPS, busy, service time, wait time 등 세부 I/O 성능을 제공합니다. 특정 디스크 병목, 지연, queue 증가를 확인할 때 사용합니다.
- 카테고리: by Disk
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
name | Disk Name | string | 물리 디스크의 이름을 표시한 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
busy | Disk Busy | % | 해당 물리 디스크가 관측 구간 동안 바쁘게 동작한 시간의 비율을 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
total | Disk IO Total | bytes/s | 해당 물리 디스크의 초당 전체 처리량을 나타내는 값입니다. 읽기와 쓰기 바이트 처리량을 합산한 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
read | Disk Read | bytes/s | 해당 물리 디스크의 초당 읽기 처리량을 나타내는 값입니다. Bytes/sec 기준으로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
write | Disk Write | bytes/s | 해당 물리 디스크의 초당 쓰기 처리량을 나타내는 값입니다. Bytes/sec 기준으로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
totalIops | Disk Total IOPS | counts/s | 해당 물리 디스크의 초당 전체 I/O 작업 수를 나타내는 값입니다. 읽기 IOPS와 쓰기 IOPS를 합산한 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
readIops | Disk Read IOPS | counts/s | 해당 물리 디스크의 초당 읽기 I/O 작업 수를 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
writeIops | Disk Write IOPS | counts/s | 해당 물리 디스크의 초당 쓰기 I/O 작업 수를 나타내는 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
readSvcTime | Disk Read Service Time | ms/io | 해당 물리 디스크가 하나의 Read IO 요청을 처리 하는데 소요된 시간을 milli second 단위로 표시한 값입니다. | AIX, Solaris, Linux, Windows |
writeSvcTime | Disk Write Service Time | ms/io | 해당 물리 디스크가 하나의 Write IO 요청을 처리 하는데 소 요된 시간을 milli second 단위로 표시한 값입니다. | AIX, Solaris, Linux, Windows |
avgWaitTime | Disk Average Wait Time | ms | HP-UX 전용 지표로 IO 처리 요청이 디스크의 대기열에서 유휴 상태로 대기한 평균 시간을 milli second 단위로 표시한 값 입니다. | HP-UX |
avgSvcTime | Disk Average Service Time | ms | HP-UX 전용 지표로 디스크에 대한 각 전송 요청(탐색, 회전 대기 시간 및 데이터 전송 시간 포함)을 처리하는 평균 시간을 milli second 단위로 표시한 값 입니다. | HP-UX |
qLength | Disk Q-Length | count | 해당 디스크에 대해 대기 중이거나 처리 중인 I/O 요청의 큐 길이 수준을 나타내는 지표입니다. 값이 낮으면 요청이 원활히 처리되고 있음을 의미하며, 값이 높게 지속되면 디스크가 요청을 제때 처리하지 못하고 있을 가능성을 시사합니다. 다만 절대적인 기준값은 디스크 종류(HDD/SSD/NVMe), 시스템 구조, workload 특성에 따라 달라질 수 있으므로, busy(%), wait time, service time과 함께 종합적으로 해석해야 합니다. | Linux, Windows |
infra_filesystem
파일시스템 또는 마운트포인트 단위의 용량 및 성능 정보를 수집하는 카테고리입니다. 총 용량, 사용량, 여유 공간, 사용률, inode 사용률, 읽기/쓰기 처리량, IOPS, queue length 등을 제공합니다. 특정 파일시스템의 공간 부족, inode 고갈, I/O 부하를 확인할 때 사용합니다.
- 카테고리: by Filesystem
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
mountName | Mount Name | string | 파일시스템이 마운트된 경로 또는 식별 이름을 나타내는 값입니다. 예를 들어 Linux/Unix에서는 /, /var, /data 같은 마운트포인트가, Windows에서는 드라이브 문자나 볼륨 경로가 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
fsType | FileSystem Type | string | 파일시스템 유형을 나타내는 값입니다. 예를 들어 ext4, xfs, zfs, vxfs, ntfs 등이 표시될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
devName | Device Name | string | 해당 파일시스템이 실제로 연결된 디바이스 이름 또는 디바이스 식별 경로를 나타내는 값입니다. Linux에서는 lsblk 의 KNAME, Unix 계열에서는 df 또는 bdf 결과의 FILESYSTEM 컬럼 값을 기준으로 표시됩니다. Windows에서는 드라이브 문자가 아닌 해당 파일시스템이 연결된 디바이스 식별 경로를 기준으로 표시합니다. | HP-UX, AIX, Solaris, Linux, Windows |
pDevName | Parent Device Name | string | 해당 디바이스가 속한 상위 부모 디바이스 이름을 나타내는 값입니다. Linux에서는 lsblk 의 PKNAME 값을 기준으로 표시되며, 파티션 또는 논리 디바이스가 어느 상위 디스크 계층에 연결되어 있는지 식별할 때 활용할 수 있습니다. 예를 들어 nvme0n1p1 의 경우 nvme0n1, sda1 의 경우 sda 와 같이 표시될 수 있습니다. Unix 계열 및 Windows에서는 Linux의 PKNAME 과 동일한 기준의 정보를 공통 방식으로 안정적으로 제공하기 어려워 비어 있거나 수집 대상에서 제외될 수 있습니다. | Linux |
totalSize | FS Total Size | GiB | 해당 파일시스템의 전체 용량을 Byte 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
used | FS Used | GiB | 해당 파일시스템에서 현재 사용 중인 용량을 Byte 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
free | FS Free | GiB | 해당 파일시스템에서 현재 사용 가능한 남은 용량을 Byte 단위로 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
pUsed | FS Used | % | 해당 파일시스템의 전체 용량 대비 사용 중인 용량의 비율을 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
pFree | FS Free | % | 해당 파일시스템의 전체 용량 대비 사용 가능한 남은 용량의 비율을 나타낸 값입니다. | HP-UX, AIX, Solaris, Linux, Windows |
pInodeUsed | FS i-node Used | % | 해당 파일시스템의 전체 inode 수 대비 사용 중인 inode의 비율을 나타낸 값입니다. 파일 개수가 매우 많을 때 용량이 남아 있어도 inode 고갈로 파일 생성이 불가능할 수 있으므로 함께 확인이 필요합니다. | HP-UX, AIX, Solaris, Linux |
read | FS Read | bytes/s | 해당 파일시스템에서 초당 읽힌 데이터 처리량을 Byte/s 단위로 나타낸 값입니다. 즉 파일시스템 기준 읽기 throughput입니다. | HHP-UX, AIX, Solaris, Linux, Windows |
write | FS Write | bytes/s | 해당 파일시스템에서 초당 기록된 데이터 처리량을 Byte/s 단위로 나타낸 값입니다. 즉 파일시스템 기준 쓰기 throughput입니다. | HP-UX, AIX, Solaris, Linux, Windows |
ioTotal | FS IO Total | bytes/s | 해당 파일시스템에서 초당 처리된 전체 데이터 처리량을 Byte/s 단위로 나타낸 값입니다. 읽기와 쓰기 데이터 처리량을 합산한 값이며, 파일시스템 기준 총 I/O throughput을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
readIops | FS Read IOPS | counts/s | 해당 파일시스템에서 초당 처리된 읽기 I/O 작업 수를 나타낸 값입니다. 파일시스템 기준 읽기 IOPS로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
writeIops | FS Write IOPS | counts/s | 해당 파일시스템에서 초당 처리된 쓰기 I/O 작업 수를 나타낸 값입니다. 파일시스템 기준 쓰기 IOPS로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
IopsTotal | FS Total IOPS | counts/s | 해당 파일시스템에서 초당 처리된 전체 I/O 작업 수를 나타낸 값입니다. 읽기 IOPS와 쓰기 IOPS를 합산한 값이며, 파일시스템 기준 총 IOPS를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
iopsTotal | FS Total IOPS | counts/s | 해당 파일시스템에서 초당 처리된 전체 I/O 작업 수를 나타낸 값입니다. 읽기 IOPS와 쓰기 IOPS를 합산한 값이며, 파일시스템 기준 총 IOPS를 의미합 니다. | HP-UX, AIX, Solaris, Linux, Windows |
qLength | FS Q-Length | count | 해당 파일시스템과 연관된 I/O 처리 요청의 큐 길이 수준을 나타내는 지표입니다. 대기 중이거나 처리 중인 요청의 평균적인 누적 수준으로 해석할 수 있습니다. 값이 일시적으로 상승하는 것은 순간적인 부하 증가로 정상일 수 있으나, 높은 상태가 지속되면 파일시스템 또는 하위 스토리지의 처리 지연 가능성을 시사합니다. 다만 절대적인 기준값은 파일시스템 종류, 스토리지 구조, workload 특성에 따라 달라질 수 있으므로 read/write 처리량, IOPS, 응답시간 계열 지표와 함께 종합적으로 해석해야 합니다. | Linux, Windows |
infra_zpool_perf
ZFS zpool 및 vdev 단위의 성능/상태 정보를 수집하는 카테고리입니다. zpool 용량, 읽기/쓰기 처리량, IOPS, queue 및 disk wait 계열 지표, scrub/trim/rebuild 관련 대기 시간을 제공합니다. ZFS 스토리지 풀의 전체 상태와 특정 vdev 또는 device의 병목 구간을 확인할 때 사용합니다.
- 카테고리: by ZFS
- 기본 수집 주기: 5초
- 최소 지원 에이전트: Linux 2.9.15+, Solaris 1.4.9+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
name | Zpool Display Name | string | 표시용 장치 이름입니다. pool 이름과 device 이름을 조합한 식별값으로, 화면상에서 zpool 또는 vdev를 구분하기 위 한 표시명으로 사용됩니다. | Linux, Solaris |
poolName | Zpool Name | string | 해당 device가 속한 ZFS zpool의 이름을 나타내는 값입니다. 동일 pool 내 여러 vdev 또는 leaf device를 그룹화하여 해석할 때 사용합니다. | Linux, Solaris |
devName | Zpool Device Name | string | 실제 vdev 또는 leaf device의 원본 이름을 나타내는 값입니다. 성능 병목이 발생한 device를 식별할 때 사용합니다. | Linux, Solaris |
devType | Zpool Device Type | string | ZFS 장치 유형을 나타내는 값입니다. 예를 들어 zpool, data, special, log, cache, spare 등의 유형으로 표시될 수 있으며, 장치의 역할 구분에 사용합니다. | Linux, Solaris |
totalSize | Total Size | byte | 해당 zpool 또는 device의 전체 크기(Allocated+Free)를 Byte 단위로 나타낸 값입니다. | Linux, Solaris |
allocated | Allocated | byte | 해당 zpool 또는 device에 현재 할당되어 있는 용량을 Byte 단위로 나타낸 값입니다. 논리적으로 이미 배정된 공간의 규모를 파악할 때 사용합니다. | Linux, Solaris |
free | Free | byte | 해당 zpool 또는 device에서 현재 사용 가능한 남은 용량을 Byte 단위로 나타낸 값입니다. 사용 가능 공간 부족 여부를 확인할 때 사용합니다. | Linux, Solaris |
pctUsed | Used | % | 해당 zpool 또는 device의 전체 용량 대비 사용 중인 용량의 비율을 백분율(%)로 나타낸 값입니다. 값이 높을수록 여유 공간이 적은 상태를 의미합니다. | Linux, Solaris |
readBytes | Read | bytes/s | 해당 zpool 또는 device의 초당 읽기 데이터 처리량을 bytes/s단위로 나타낸 값입니다. ZFS 기준 읽기 throughput 지표를 의미합니다. | Linux, Solaris |
writeBytes | Write | bytes/s | 해당 zpool 또는 device의 초당 쓰기 데이터 처리량을 bytes/s 단위로 나타낸 값입니다. ZFS 기준 쓰기 throughput 지표를 의미합니다. | Linux, Solaris |
totalBytes | Read+Write | bytes/s | 해당 zpool 또는 device의 초당 전체 데이터 처리량을 bytes/s 단위로 나타낸 값입니다. 읽기 처리량과 쓰기 처리량을 합산한 총 throughput 지표입니다. | Linux, Solaris |
readOperation | Read IOPS | counts/s | 해당 zpool 또는 device에서 초당 처리된 읽기 I/O 작업 수를 나타낸 값입니다. ZFS 기준 읽기 IOPS를 의미합니다. | Linux, Solaris |
writeOperation | Write IOPS | counts/s | 해당 zpool 또는 device에서 초당 처리된 쓰기 I/O 작업 수를 나타낸 값입니다. ZFS 기준 쓰기 IOPS를 의미합니다. | Linux, Solaris |
totalOperation | Read+Write IOPS | counts/s | 해당 zpool 또는 device에서 초당 처리된 전체 I/O 작업 수를 나타낸 값입니다. 읽기 IOPS와 쓰기 IOPS를 합산한 총 IOPS 지표입니다. | Linux, Solaris |
asyncqReadWait_ns | Asyncq Read Wait | ns | 읽기 I/O 요청이 ZFS 내부 asynchronous queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. 값이 높을수록 비동기 읽기 요청이 queue에서 지연되고 있음을 시사합니다. | Linux |
asyncqWriteWait_ns | Asyncq Write Wait | ns | 쓰기 I/O 요청이 ZFS 내부 asynchronous queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. 값이 높을수록 비동기 쓰기 요청이 queue에서 지연되고 있음을 시사합니다. | Linux |
totalAsyncqWait_ns | Asyncq Total Wait | ns | 읽기/쓰기 I/O 요청이 ZFS 내부 asynchronous queue에서 대기한 전체 평균 시간을 ns 단위로 나타낸 값입니다. async queue 병목 수준을 종합적으로 확인할 때 사용합니다. | Linux |
syncqReadWait_ns | Syncq Read Wait | ns | 읽기 I/O 요청이 ZFS 내부 synchronous queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. 동기 읽기 요청 처리 지연 수준을 파악할 때 사용합니다. | Linux |
syncqWriteWait_ns | Syncq Write Wait | ns | 쓰기 I/O 요청이 ZFS 내부 synchronous queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. 동기 쓰기 요청 처리 지연 수준을 파악할 때 사용합니다. | Linux |
totalSyncqWait_ns | Syncq Total Wait | ns | 읽기/쓰기 I/O 요청이 ZFS 내부 synchronous queue에서 대기한 전체 평균 시간을 ns 단위로 나타낸 값입니다. sync queue 병목 여부를 종합적으로 확인할 때 사용합니다. | Linux |
diskReadWait_ns | Disk Read Wait | ns | 읽기 I/O 요청이 실제 디스크 계층에서 처리되는 데 소요 된 평균 시간을 ns 단위로 나타낸 값입니다. queue 대기 이후 실제 장치 처리 지연 수준을 파악할 때 사용합니다. | Linux |
diskWriteWait_ns | Disk Write Wait | ns | 쓰기 I/O 요청이 실제 디스크 계층에서 처리되는 데 소요된 평균 시간을 ns 단위로 나타낸 값입니다. queue 대기 이후 실제 장치 처리 지연 수준을 파악할 때 사용합니다. | Linux |
totalDiskWait_ns | Disk Total Wait | ns | 읽기/쓰기 I/O 요청이 실제 디스크 계층에서 처리되는 전체 평균 시간을 ns 단위로 나타낸 값입니다. 장치 자체의 처리 지연 수준을 종합적으로 확인할 때 사용합니다. | Linux |
totalReadWait_ns | Total Read Wait | ns | 읽기 I/O 요청의 전체 평균 지연시간을 ns 단위로 나타낸 값입니다. ZFS 내부 queue 대기 시간과 실제 디스크 처리 시간이 모두 포함됩니다. | Linux |
totalWriteWait_ns | Total Write Wait | ns | 쓰기 I/O 요청의 전체 평균 지연시간을 ns 단위로 나타낸 값입니다. ZFS 내부 queue 대기 시간과 실제 디스크 처리 시간이 모두 포함됩니다. | Linux |
totalWait_ns | Total Wait | ns | 읽기/쓰기 I/O 요청 전체의 평균 지연시간을 ns 단위로 나타낸 값입니다. queue 대기와 실제 디스크 처리 시간을 모두 포함한 통합 wait 지표입니다. 값이 높을수록 해당 zpool 또는 device의 I/O 지연 가능성을 시사합니다. | Linux |
scrub_ns | Scrub | ns | scrub 작업이 ZFS 내부 queue에서 대기한 평균 시간 을 ns 단위로 나타낸 값입니다. scrub은 pool 내 블록을 순차적으로 읽어 체크섬을 검증하고 데이터 이상 여부를 확인하는 작업입니다. | Linux |
trim_ns | Trim | ns | trim 작업이 ZFS 내부 queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. trim은 SSD 또는 thin provisioning 장치에 사용하지 않는 블록을 반환하는 작업입니다. | Linux |
rebuild_ns | Rebuild | ns | rebuild 작업이 ZFS 내부 queue에서 대기한 평균 시간을 ns 단위로 나타낸 값입니다. 장치 교체 또는 복구 과정에서 필요한 데이터를 다시 구성하는 작업의 지연 수준을 나타냅니다. | Linux |
infra_vxlv_perf
Veritas Volume Manager 환경에서 Logical Volume(vxlv) 단위의 I/O 성능 정보를 수집한 데이터입니다. 디스크그룹 및 볼륨별로 읽기/쓰기 IOPS, 처리량, 평균 지연시간 등의 지표를 제공하며, 볼륨 단위의 성능 추이, 병목 여부, 읽기/쓰기 편중 현상 등을 분석하는 데 활용합니다.
- 카테고리: by VxLV
- 기본 수집 주기: 5초
- 최소 지원 에이전트: Linux 2.9.15+
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
name | VxLV Display Name | string | 표시용 장치 이름입니다. Disk Group 이름과 VxLvol 이름을 조합한 식별값으로 사용될 수 있습니다. | Linux |
diskGroup | VxLV Disk Group | string | 해당 볼륨이 속한 Veritas Disk Group 이름입니다. 여러 볼륨을 논리적으로 묶는 관리 단위이며, 동일 Disk Group 내 볼륨들을 함께 식별하거나 집계할 때 사용합니다. | Linux |
vxLvolName | VxLV Lvol Name | string | Veritas Volume Manager에서 관리하는 Logical Volume 이름입니다. 성능 지표의 측정 대상이 되는 볼륨 식별자입니다. | Linux |
blockSize | VxLV Block Size | string | 해당 볼륨의 I/O 블록 크기를 나타내는 값입니다. Byte 단위로 표현하며, 블록 수 기반 지표를 바이트 단위 처리량으로 환산할 때 사용합니다. vxprint -F %iosize 조회값을 기준으로 하며, 조회 실패 또는 비정상 값인 경우 512바이트로 fallback 됩니다. | Linux |
readIops | Read IOPS | counts/s | 수집 구간 동안 발생한 Read operation 수를 구간 시간으로 나눈 초당 평균 읽기 작업 수입니다. 볼륨의 읽기 요청 처리 빈도를 나타냅니다. | Linux |
writeIops | Write IOPS | counts/s | 수집 구간 동안 발생한 Write operation 수를 구간 시간으로 나눈 초당 평균 쓰기 작업 수입니다. 볼륨의 쓰기 요청 처리 빈도를 나타냅니다. | Linux |
IopsTotal | Total IOPS | counts/s | 수집 구간 동안 발생한 전체 I/O operation 수를 구간 시간으로 나눈 초당 평균 작업 수입니다. Read IOPS와 Write IOPS의 합으로 해석합니다. | Linux |
read | Read | bytes/s | 수집 구간 동안 처리된 읽기 블록 수에 I/O 블록 크기를 곱한 뒤, 구간 시간으로 나눈 초당 평균 읽기 처리량입니다. 단위는 bytes/s 입니다. | Linux |
write | Write | bytes/s | 수집 구간 동안 처리된 쓰기 블록 수에 I/O 블록 크기를 곱한 뒤, 구간 시간으로 나눈 초당 평균 쓰기 처리량입니다. 단위는 bytes/s 입니다. | Linux |
total | IO Total | bytes/s | 수집 구간 동안 처리된 전체 I/O 데이터량을 구간 시간으로 나눈 초당 평균 처리량입니다. 읽기 처리량과 쓰기 처리량의 합을 의미합니다. | Linux |
readAvgMs | Read Average Latency | ms | 수집 구간 동안 발생한 읽기 작업의 평균 지연시간입니다. 각 읽기 요청이 완료되기까지 걸린 시간을 평균한 값이며, 단위는 밀리초(ms)입니다. | Linux |
writeAvgMs | Write Average Latency | ms | 수집 구간 동안 발생한 쓰기 작업의 평균 지연시간입니다. 각 쓰기 요청이 완료되기까지 걸린 시간을 평균한 값이며, 단위는 밀리초(ms)입니다. | Linux |
infra_cpu_core
CPU 논리 코어별 사용 상태를 수집하는 카테고리입니다. coreId 기준으로 user, sys, wait, idle, irq, softirq, steal, core CPU 사용률 등을 제공합니다. 특정 코어 편중, IRQ 쏠림, 단일 스레드 병목을 확인할 때 사용합니다.
- 카테고리: by CPU Core
- 기본 수집 주기: 5초
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
coreId | Core ID | string | CPU 코어를 식별하기 위한 ID 값입니다. OS가 인식하는 논리 코어 번호를 의미하며, 물리 코어와 1:1로 대응되지 않을 수 있습니다. Hyper-Threading/SMT가 활성화된 경우 하나의 물리 코어에 여러 논리 코어가 매핑될 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
coreCpu | CPU | % | 해당 Core의 전체 CPU 사용률을 의미합니다. 100 - idle로 계산하며, 사용자 모드(user), 커널 모드(sys), nice, I/O 대기(wait), irq, softirq, steal 등 비유휴 시간을 모두 포함한 사용 비율로 해석합니다. 운영체제에 따라 포함 항목은 다를 수 있습니다. | HP-UX, AIX, Solaris, Linux, Windows |
user | User | % | 해당 Core의 전체 CPU 시간 중 사용자 모드(User mode) 에서 일반 애플리케이션/프로세스를 실행하는 데 사용된 비율을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
sys | Sys | % | 해당 Core의 전체 CPU 시간 중 커널 모드(System mode) 에서 시스템 콜 처리, 커널 작업, 드라이버 처리 등에 사용된 비율을 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
nice | Nice | % | 해당 Core의 전체 CPU 시간 중 낮은 우선순위(niced) 사용자 프로세스 실행에 사용된 비율을 의미합니다. 일반 우선순위의 사용자 프로세스 사용률은 보통 user(%)에 포함됩니다. | HP-UX |
wait | Wait | % | 해당 Core의 전체 CPU 시간 중 CPU가 I/O 완료를 기다리며 유휴 상태로 있었던 비율(I/O wait) 을 의미합니다. CPU가 실제 연산을 수행한 시간이 아니라, 디스크/네트워크 등 외부 자원 응답을 기다린 시간으로 해석합니다. | HP-UX, AIX, Solaris, Linux |
total | User+Sys | % | 해당 Core의 전체 CPU 사용률 중 사용자 모드(user) 와 커널 모드(sys) 에서 사용된 비율의 합을 의미합니다. I/O 대기(wait), irq, softirq, steal 등은 제외한 순수 CPU 실행 사용률로 해석합니다. | HP-UX, AIX, Solaris, Linux, Windows |
total_wait | User+Sys+Wait | % | 해당 Core의 전체 CPU 시간 중 user + sys + wait 의 합을 의미합니다. 즉 사용자 처리, 커널 처리, I/O 대기를 함께 포함한 사용 지표입니다. 운영체제에 따라 실제 전체 CPU 사용률과 차이가 있을 수 있습니다. | HP-UX, AIX, Solaris, Linux |
idle | Idle | % | 해당 Core의 전체 CPU 시간 중 아무 작업도 수행하지 않고 유휴 상태로 있었던 비율을 의미합니다. 값이 높을수록 해당 코어의 여유가 많은 상태를 의미합니다. | HP-UX, AIX, Solaris, Linux, Windows |
irq | Irq | % | 해당 Core의 전체 CPU 시간 중 하드웨어 인터럽트(IRQ) 를 처리하는 데 사용된 비율을 의미합니다. 네트워크 카드, 디스크, 기타 하드웨어 이벤트가 특정 코어에 집중될 때 증가할 수 있습니다. | Linux |
softirq | Softirq | % | 해당 Core의 전체 CPU 시간 중 소프트웨어 인터럽트(SoftIRQ) 를 처리하는 데 사 용된 비율을 의미합니다. 네트워크 패킷 처리, 블록 I/O 후처리 등 커널의 지연 처리 작업이 특정 코어에 집중될 때 증가할 수 있습니다. | Linux |
steal | Steal | % | 가상화 환경에서 하이퍼바이저가 다른 가상 CPU를 우선 처리하는 동안, 해당 Core가 실행되지 못하고 빼앗긴 시간의 비율을 의미합니다. 값이 높으면 VM에 할당된 CPU 자원이 부족하거나 과경합 상태일 수 있습니다. | Linux |
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
numaNodeId | NUMA Node ID | string | 해당 논리 코어가 속한 NUMA 노드 번호. NUMA 연결 정보를 확인할 수 없는 코어는 -1 | Linux |
메트릭스 익스플로러의 CPU Core 차트 범례는 이 필드를 사용해 Core cpu1 (Node 0) 형태로 표시합니다. 값이 -1인 코어와 필드를 수집하지 않는 Windows·Unix 환경에서는 Core cpu1 형태를 유지합니다.
infra_os_parameter
운영체제의 커널·시스템 파라미터 값을 수집하는 카테고리입니다. 네트워크, 파일시스템, 커널 영역의 주요 파라미터와 현재 설정값을 제공합니다. 서버 간 설정 편차를 비교하거나, 성능 문제의 원인이 될 수 있는 커널 설정값을 확인할 때 사용합니다. 수집한 값은 실험실의 OS Parameter 정보 화면에서 조회할 수 있습니다.
- 카테고리: OS Parameter
- 기본 수집 주기: 1시간
| Field | Title | Unit | Description | OS |
|---|---|---|---|---|
parameter | Parameter | string | 파라미터 이름(예: net.ipv4.tcp_keepalive_intvl) | AIX, HP-UX, Solaris, Linux |
category | Category | string | 파라미터가 속한 영역(예: net, fs, kernel) | AIX, HP-UX, Solaris, Linux |
os | OS | string | 파라미터를 수집한 운영체제 종류 | AIX, HP-UX, Solaris, Linux |
value | Value | string | 파라미터의 현재 설정값 | AIX, HP-UX, Solaris, Linux |
custom | Custom | string | 기본 수집 대상이 아니라 사용자가 os.parameter.custom 옵션으로 추가한 파라미터인지 여부 | AIX, HP-UX, Solaris, Linux |
기본 수집 대상 외의 파라미터를 추가하려면 os.parameter.custom 옵션에 파라미터 이름을 쉼표(,)로 구분해 입력하세요. 수집 주기는 infra_os_parameter.interval 옵션으로 조정합니다. 기본값은 3600초입니다.
Windows는 이 카테고리를 수집하지 않습니다.