5. JSON으로 예상 VRAM과 부하 정보 출력
whichllm의 JSON 결과에는 다음과 같은 정보가 포함될 수 있습니다.
fit_type: 전체 GPU 적재, 부분 오프로딩, CPU 실행 등의 적합 방식
vram_required_bytes: 예상 필요 VRAM
vram_available_bytes: 사용 가능한 VRAM
estimated_tok_per_sec: 예상 생성 속도
speed_range_tok_per_sec: 예상 속도 범위
speed_confidence: 속도 추정 신뢰도
speed_notes: 속도 및 병목 관련 설명
RTX 5080 결과를 JSON 파일로 저장:
whichllm --gpu "RTX 5080" --top 10 --json |
Set-Content -Encoding utf8 ".\whichllm-rtx5080.json"
RTX 5090 결과 저장:
whichllm --gpu "RTX 5090" --top 10 --json |
Set-Content -Encoding utf8 ".\whichllm-rtx5090.json"
PowerShell에서 VRAM GB와 점유율 계산
다음 스크립트는 RTX 5080을 가정하고 추천 모델별 예상 VRAM 사용량과 VRAM 점유율을 표로 출력합니다.
$result = whichllm --gpu "RTX 5080" --top 10 --json | ConvertFrom-Json
$table = $result.models | ForEach-Object {
$required = [double]$_.vram_required_bytes
$available = [double]$_.vram_available_bytes
[pscustomobject]@{
Model = $_.model_id
Fit = $_.fit_type
Required_VRAM_GB = [math]::Round($required / 1GB, 2)
Available_VRAM_GB = [math]::Round($available / 1GB, 2)
VRAM_Usage_Percent = if ($available -gt 0) {
[math]::Round(($required / $available) * 100, 1)
} else {
$null
}
Estimated_Tok_S = $_.estimated_tok_per_sec
Speed_Confidence = $_.speed_confidence
Speed_Notes = $_.speed_notes
}
}
$table | Format-Table -AutoSize
결과를 CSV로 저장:
$table | Export-Csv -NoTypeInformation -Encoding utf8 ".\whichllm-rtx5080-vram.csv"
[!WARNING]
위 VRAM_Usage_Percent는 실제 GPU 사용률이 아니라 예상 필요 VRAM ÷ 사용 가능 VRAM으로 계산한 메모리 점유 예상치입니다.
6. 실제 실행 중 GPU 부하와 VRAM 측정
whichllm은 계획 도구이므로 실제 GPU 사용률, 전력, 온도는 nvidia-smi로 확인합니다.
현재 상태 한 번 확인
nvidia-smi
1초마다 실시간 모니터링
nvidia-smi `
--query-gpu=timestamp,name,utilization.gpu,utilization.memory,memory.used,memory.total,power.draw,temperature.gpu `
--format=csv `
-l 1
확인 가능한 항목:
utilization.gpu: 실제 GPU 연산 사용률
utilization.memory: GPU 메모리 컨트롤러 사용률
memory.used: 실제 VRAM 사용량
memory.total: 전체 VRAM
power.draw: 소비전력
temperature.gpu: GPU 온도
종료하려면 Ctrl+C를 누릅니다.
측정 결과를 파일로 저장
nvidia-smi `
--query-gpu=timestamp,name,utilization.gpu,utilization.memory,memory.used,memory.total,power.draw,temperature.gpu `
--format=csv `
-l 1 |
Tee-Object -FilePath ".\gpu-load-log.csv"
모델을 먼저 실행한 다음 이 명령을 별도의 PowerShell 창에서 실행하면 실제 추론 부하를 기록할 수 있습니다.
7. 빠른 실행 순서
아래 순서대로 실행하면 됩니다.
# 1. 현재 하드웨어 확인
whichllm hardware
# 2. RTX 5080에서 실행 가능한 모델 추천
whichllm --gpu "RTX 5080" --gpu-only --speed usable --vram-headroom 1GB --top 10
# 3. Gemma 4 Q3_K_M 예상 확인
whichllm plan "google/gemma-4-26B-A4B-it" --quant Q3_K_M --context-length 8192
# 4. Gemma 4 Q4_0 예상 확인
whichllm plan "google/gemma-4-26B-A4B-it" --quant Q4_0 --context-length 8192
# 5. 전체 예상치를 JSON으로 저장
whichllm --gpu "RTX 5080" --top 10 --json |
Set-Content -Encoding utf8 ".\whichllm-rtx5080.json"
# 6. 실제 모델 실행 중 별도 PowerShell에서 GPU 부하 측정
nvidia-smi `
--query-gpu=timestamp,name,utilization.gpu,utilization.memory,memory.used,memory.total,power.draw,temperature.gpu `
--format=csv `
-l 1
참고 자료