GPU Device
GPU Device 화면에서는 모니터링 대상 GPU 디바이스 각각의 상태를 맵과 목록으로 확인하고, 디바이스별 상세 정보·지표·프로세스·알람을 확인할 수 있습니다.
좌측 메뉴에서 GPU > GPU Device를 선택하세요.

화면 상단의 Host/Kubernetes 탭으로 조회 기준을 전환할 수 있으며, 화면은 좌측 Filters 패널, 요약 카드, GPU Device Map, GPU Device List 영역으로 구성됩니다.
요약 카드에서 GPU 현황 파악하기
- GPU Devices: Total/GPU/MIG Instance로 구분한 디바이스 수입니다.
- Physical GPU: MIG Instance의 상위 물리 GPU를 포함한 물리 GPU 수입니다. 제목 옆 ? 아이콘을 클릭하면 집계 기준을 확인할 수 있습니다.
- GPU Status: Active(활동 있음)/Idle(활동 없음) 디바이스 수입니다.
- Alert: 심각도별(Normal/Warning/Critical) 디바이스 수입니다.
GPU Device Map에서 디바이스 상태 확인하기
GPU Device Map에서는 GPU 디바이스별 상태를 육각형 타일로 시각화해 보여줍니다. 타일 안의 배지로 G(GPU)/M(MIG Instance)를 구분하고, 타일 색상으로 알람 심각도를 구분합니다.
- 심각도순으로 표시(Sort by severity)를 켜면 알람 심각도가 높은 디바이스부터 표시됩니다.
그룹화해서 보기
맵 우측 상단의 Group 드롭다운에서 그룹화 기준을 선택하면 맵이 해당 기준으로 묶여서 표시됩니다.
| 옵션 | 설명 |
|---|---|
| Physical GPU | 물리 GPU 단위로 묶어서 표시합니다(MIG Instance는 상위 물리 GPU 아래에 표시). |
| None | 그룹화 없이 전체 디바이스를 나열합니다. |
| Host | 호스트(Host 탭) 또는 Node(Kubernetes 탭) 단위로 묶어서 표시합니다. |
| GPU Model | GPU 모델 단위로 묶어서 표시합니다. |
GPU Device List에서 상세 수치 확인하기
GPU Device List에서 디바이스별 상세 지표를 확인할 수 있습니다. GPU Device Name, Index, GPU Type, GPU Model, Host Name(Kubernetes 탭에서는 Node Name), GPU Status, Alert, GPU Util(%), SM Util(%), Memory Usage(%), Pwr:Usage/Cap(W), Temp(°C), Process Count, Profile, GI ID, CI ID, Active Memory가 표시됩니다.
- 물리 GPU 행 좌측의 화살표를 클릭하면 하위 MIG Instance 행을 펼치거나 접을 수 있습니다.
- 목록 상단의 필터 입력란에 텍스트를 입력하면 컬럼 값 기준으로 빠르게 필터링할 수 있습니다.
디바이스 상세 확인하기
GPU Device Name을 클릭하면 화면 우측에 GPU 상세 패널이 열립니다. Host 탭에서는 Information, Metric, Process, Alert 탭으로, Kubernetes 탭에서는 여기에 Pod 탭이 추가되어 전환할 수 있습니다.
Information 탭
디바이스의 기본 정보와 현재 스냅샷을 확인할 수 있습니다.

- Information에서 GPU Index, Driver Version, Model Name, Cuda Version, Vbios Version, Bus ID, UUID, Host, Status, Alert를 확인할 수 있습니다.
- Current Snapshot에서 GPU Utilization, Memory Usage, Power Usage, Temperature를 게이지로 확인할 수 있고, P-State, XID(Last Code, Recent XID(5m)), ECC Error(Aggregate Uncorrectable, Volatile Uncorrectable, Aggregate Correctable)를 함께 확인할 수 있습니다.
Metric 탭
디바이스의 주요 지표를 차트로 확인할 수 있습니다.

- GPU Utilization (%), SM Utilization (%), FB Memory Usage, Memory Utilization (%), PCIe/NVLink, Temperature (°C), Power (W), SM Clock (MHz), Memory Clock (MHz), Graphic Clock (MHz), Video Clock (MHz), Fan Speed (%), Decoder/Encoder Utilization (%) 차트가 표시됩니다.
- 차트 우측 상단에서 조회 기간을 변경할 수 있습니다. Live 상태에서는 실시간으로 갱신됩니다.
Process 탭
디바이스에서 실행 중인 프로세스 목록을 확인할 수 있습니다.

- Type, GI ID, CI ID, PID, PPID, Process Name, Args, User Name과 프로세스별 자원 사용량이 표시됩니다. MIG 미사용 GPU에서는 GI ID/CI ID가 N/A로 표시됩니다.
Pod 탭 (Kubernetes 탭 전용)
이 GPU 디바이스를 사용 중인 Pod 목록을 확인할 수 있습니다. Type, Pod Name, Namespace, Containers, Alert, Status, Controlled By, QoS 등이 표시됩니다. 디바이스에 할당된 Pod가 없으면 "No data."가 표시됩니다.

Alert 탭
이 디바이스에 적용된 알람 룰과 발생 현황을 확인할 수 있습니다.

- Rule Name, Alert Stat Name, Target, Alert Detail, Last Triggered, Rule Type 등이 표시됩니다.
- 발생 알람만 보기 체크박스를 켜면 알람이 발생한 룰만 표시됩니다.
- [목록]/[Bar] 버튼으로 표시 형태를 전환할 수 있습니다.
디바이스가 Idle 상태이거나 모니터링이 중단되면 Process·Metric 등 실시간 데이터가 수집되지 않아 표시되지 않을 수 있습니다.