본문으로 건너뛰기

GPU Device

GPU Device 화면에서는 모니터링 대상 GPU 디바이스 각각의 상태를 맵과 목록으로 확인하고, 디바이스별 상세 정보·지표·프로세스·알람을 확인할 수 있습니다.

좌측 메뉴에서 GPU > GPU Device를 선택하세요.

GPU Device 전체 화면

화면 상단의 Host/Kubernetes 탭으로 조회 기준을 전환할 수 있으며, 화면은 좌측 Filters 패널, 요약 카드, GPU Device Map, GPU Device List 영역으로 구성됩니다.

요약 카드에서 GPU 현황 파악하기

  • GPU Devices: Total/GPU/MIG Instance로 구분한 디바이스 수입니다.
  • Physical GPU: MIG Instance의 상위 물리 GPU를 포함한 물리 GPU 수입니다. 제목 옆 ? 아이콘을 클릭하면 집계 기준을 확인할 수 있습니다.
  • GPU Status: Active(활동 있음)/Idle(활동 없음) 디바이스 수입니다.
  • Alert: 심각도별(Normal/Warning/Critical) 디바이스 수입니다.

GPU Device Map에서 디바이스 상태 확인하기

GPU Device Map에서는 GPU 디바이스별 상태를 육각형 타일로 시각화해 보여줍니다. 타일 안의 배지로 G(GPU)/M(MIG Instance)를 구분하고, 타일 색상으로 알람 심각도를 구분합니다.

  • 심각도순으로 표시(Sort by severity)를 켜면 알람 심각도가 높은 디바이스부터 표시됩니다.

그룹화해서 보기

맵 우측 상단의 Group 드롭다운에서 그룹화 기준을 선택하면 맵이 해당 기준으로 묶여서 표시됩니다.

옵션설명
Physical GPU물리 GPU 단위로 묶어서 표시합니다(MIG Instance는 상위 물리 GPU 아래에 표시).
None그룹화 없이 전체 디바이스를 나열합니다.
Host호스트(Host 탭) 또는 Node(Kubernetes 탭) 단위로 묶어서 표시합니다.
GPU ModelGPU 모델 단위로 묶어서 표시합니다.

GPU Device List에서 상세 수치 확인하기

GPU Device List에서 디바이스별 상세 지표를 확인할 수 있습니다. GPU Device Name, Index, GPU Type, GPU Model, Host Name(Kubernetes 탭에서는 Node Name), GPU Status, Alert, GPU Util(%), SM Util(%), Memory Usage(%), Pwr:Usage/Cap(W), Temp(°C), Process Count, Profile, GI ID, CI ID, Active Memory가 표시됩니다.

  • 물리 GPU 행 좌측의 화살표를 클릭하면 하위 MIG Instance 행을 펼치거나 접을 수 있습니다.
  • 목록 상단의 필터 입력란에 텍스트를 입력하면 컬럼 값 기준으로 빠르게 필터링할 수 있습니다.

디바이스 상세 확인하기

GPU Device Name을 클릭하면 화면 우측에 GPU 상세 패널이 열립니다. Host 탭에서는 Information, Metric, Process, Alert 탭으로, Kubernetes 탭에서는 여기에 Pod 탭이 추가되어 전환할 수 있습니다.

Information 탭

디바이스의 기본 정보와 현재 스냅샷을 확인할 수 있습니다.

GPU 상세 패널 - Information 탭

  • Information에서 GPU Index, Driver Version, Model Name, Cuda Version, Vbios Version, Bus ID, UUID, Host, Status, Alert를 확인할 수 있습니다.
  • Current Snapshot에서 GPU Utilization, Memory Usage, Power Usage, Temperature를 게이지로 확인할 수 있고, P-State, XID(Last Code, Recent XID(5m)), ECC Error(Aggregate Uncorrectable, Volatile Uncorrectable, Aggregate Correctable)를 함께 확인할 수 있습니다.

Metric 탭

디바이스의 주요 지표를 차트로 확인할 수 있습니다.

GPU 상세 패널 - Metric 탭

  • GPU Utilization (%), SM Utilization (%), FB Memory Usage, Memory Utilization (%), PCIe/NVLink, Temperature (°C), Power (W), SM Clock (MHz), Memory Clock (MHz), Graphic Clock (MHz), Video Clock (MHz), Fan Speed (%), Decoder/Encoder Utilization (%) 차트가 표시됩니다.
  • 차트 우측 상단에서 조회 기간을 변경할 수 있습니다. Live 상태에서는 실시간으로 갱신됩니다.

Process 탭

디바이스에서 실행 중인 프로세스 목록을 확인할 수 있습니다.

GPU 상세 패널 - Process 탭

  • Type, GI ID, CI ID, PID, PPID, Process Name, Args, User Name과 프로세스별 자원 사용량이 표시됩니다. MIG 미사용 GPU에서는 GI ID/CI ID가 N/A로 표시됩니다.

Pod 탭 (Kubernetes 탭 전용)

이 GPU 디바이스를 사용 중인 Pod 목록을 확인할 수 있습니다. Type, Pod Name, Namespace, Containers, Alert, Status, Controlled By, QoS 등이 표시됩니다. 디바이스에 할당된 Pod가 없으면 "No data."가 표시됩니다.

GPU 상세 패널 - Process 탭

Alert 탭

이 디바이스에 적용된 알람 룰과 발생 현황을 확인할 수 있습니다.

GPU 상세 패널 - Alert 탭

  • Rule Name, Alert Stat Name, Target, Alert Detail, Last Triggered, Rule Type 등이 표시됩니다.
  • 발생 알람만 보기 체크박스를 켜면 알람이 발생한 룰만 표시됩니다.
  • [목록]/[Bar] 버튼으로 표시 형태를 전환할 수 있습니다.
참고

디바이스가 Idle 상태이거나 모니터링이 중단되면 Process·Metric 등 실시간 데이터가 수집되지 않아 표시되지 않을 수 있습니다.