본문으로 건너뛰기

GPU Workload Overview

GPU Workload Overview 화면에서는 Kubernetes 워크로드(Pod)에 할당된 GPU 디바이스의 사용 현황을 워크로드 단위로 확인할 수 있습니다.

좌측 메뉴에서 GPU > GPU Workload Overview를 선택하세요.

GPU Workload Overview 전체 화면

GPU 지표는 각 워크로드(Pod)에 할당된 디바이스 타입(GPU 또는 MIG Instance) 단위로 집계되며, 선택한 Group by 기준에 따라 그룹화되어 표시됩니다. 화면은 필터 영역, 요약 카드, Workload Breakdown/Workload GPU Performance Trend, Pod List 세 영역으로 구성됩니다.

참고

이 화면은 Kubernetes 워크로드를 대상으로 하므로 Cluster 필터만 제공되며, GPU Resource Overview의 Host 탭과 달리 Host 기준 조회는 지원하지 않습니다.

워크로드 그룹화 기준 선택하기

Group by 드롭다운에서 워크로드를 묶는 기준을 선택할 수 있습니다.

옵션설명
WorkloadDeployment, StatefulSet 등 워크로드 단위로 그룹화합니다.
Workload Type워크로드 종류(Deployment, StatefulSet 등) 단위로 그룹화합니다.
NamespaceNamespace 단위로 그룹화합니다.

Workload 필터에서는 조회할 워크로드를 이름으로 좁혀서 선택할 수 있습니다. 필터 우측의 [Option]에서는 GPU Resource Overview와 동일하게 GPU Type, GPU Model로 범위를 좁힐 수 있습니다.

요약 카드에서 워크로드 GPU 현황 확인하기

  • Physical GPU: 조회 범위에 포함된 물리 GPU 수입니다.
  • GPU Devices: Total/GPU/MIG Instance로 구분한 디바이스 수입니다. 제목 옆 ? 아이콘을 클릭하면 집계 기준 툴팁을 확인할 수 있습니다.
  • Pod / Workload: 조회 범위에 포함된 Pod 수와 워크로드 수입니다.
  • AVG GPU Utilization (%): 전체 워크로드의 평균 GPU 사용률을 MIN/AVG/MAX로 보여줍니다.
  • Memory Usage (%): 전체 워크로드의 메모리 사용량(Used/Total)과 사용률을 보여줍니다.

GPU Devices 카드 툴팁

Workload Breakdown에서 워크로드별 사용률 비교하기

Workload Breakdown 영역에서는 그룹화된 워크로드별로 Avg GPU Util, Avg SM Util, Mem Usage 막대를 나란히 비교할 수 있습니다.

  • Sort 드롭다운과 [Descending]/[Ascending] 버튼으로 정렬 기준과 방향을 바꿀 수 있습니다.
  • [Reset]을 클릭하면 정렬과 선택 상태가 초기화됩니다.
  • 워크로드 카드를 클릭하면 우측 Workload GPU Performance Trend와 하단 Pod List가 해당 워크로드로 필터링됩니다.

Workload GPU Performance Trend에서 추이 확인하기

Top 10 GPU Utilization (%) 리스트에서 GPU 사용률이 높은 상위 워크로드를 확인할 수 있고, 우측 GPU Utilization (%)/SM Utilization (%) 차트에서 시간대별 추이를 확인할 수 있습니다.

  • by Pod 토글을 켜면 워크로드 단위 집계 대신 Pod별 개별 시계열로 차트가 표시됩니다. 토글 옆 ? 아이콘에서 자세한 설명을 확인할 수 있습니다.
  • 우측 상단 AVG/MIN/MAX 버튼으로 차트에 표시할 집계 방식을 전환할 수 있습니다.

by Pod 툴팁

Pod List에서 Pod별 GPU 사용 현황 확인하기

Pod List에서 Pod별 GPU 사용 현황을 확인할 수 있습니다. Pod Name, Pod Status, GPU Device, GPU Status, GPU Process Type, GPU Util(%), SM Util(%), Memory Usage(%), Namespace, Workload가 표시됩니다.

목록 상단의 필터 입력란에 텍스트를 입력하면 컬럼 값 기준으로 빠르게 필터링할 수 있습니다.

Pod 상세에서 GPU 정보 확인하기

Pod Name을 클릭하면 화면 우측에 Pod 상세 패널이 열립니다. 상단 탭으로 Information, Metric, Event, YAML, Log, Container, GPU, PVC, Alert를 전환할 수 있습니다.

Pod 상세 패널 - Information 탭

Information 탭에서는 Related Resources(리소스 토폴로지)와 Pod 기본 정보(Cluster, Node, Namespace, Status 등)를 확인할 수 있습니다.

GPU 탭에서는 이 Pod에 할당된 GPU 디바이스 상세를 확인할 수 있습니다.

Pod 상세 패널 - GPU 탭

  • GPU List에서 할당된 GPU/MIG의 이름·인덱스·모델명·MIG UUID·Profile·메모리 사용량을 확인할 수 있습니다.
  • GPU Resource Map에서 Node → GPU → MIG → Deployment → ReplicaSet → Pod로 이어지는 리소스 관계를 시각적으로 확인할 수 있습니다.
  • GPU Stat에서 GPU Utilization, SM Utilization, FB Memory Usage, Memory Utilization 등 이 Pod가 사용 중인 GPU의 실시간 지표를 차트로 확인할 수 있습니다.
참고

Information/Metric/Event/YAML/Log/Container/PVC/Alert 탭은 Kubernetes Pod 상세 패널과 동일하게 구성됩니다.