추론 시, 적재 가능한 LLM 모델 크기는?
LLM 추론 시, 적재할 수 있는 LLM 모델의 크기는 해당 GPU 제품의 메모리 용량 크기를 기준으로 결정됩니다.
서비스 하고자 하는 크기의 LLM 모델을 적재할 수 없거나 부족할 경우, 서비스 자체를 제공할 수 없습니다. 따라서, 모델의 크기를 축소하거나 구조의 최적화를 통해 필요 메모리의 요구량을 낮추는 전략이 필요합니다.
또는, GPU를 업그레이드 하거나, 추가로 탑재하면 원하는 크기의 모델을 적재할 수 있습니다.
퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

#이미지: 엔비디아 H200 x 8장이 탑재된 NVIDIA HGX H200 x 8GPU 보드
비교표 목록
* Tip: 목록을 클릭하면 해당 비교표로 이동, TOP 버튼을 클릭하면 상단으로 올라옵니다.
#01. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP32 기준)
FP32 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.
1. 계산공식(1): GPU 1개 당 메모리 용량 x 0.25 = 적재 가능한 모델 크기. 예) B200 메모리 용량 180GB x 0.25 = 45B
2. 계산공식(2): 적재할 LLM 크기 x 4 byte (FP32는 파라미터 당 4byte 할당) = 필요 메모리 용량. 예) 20B x 4 = 80GB
3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.
4. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, GPU 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#02. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP16 기준)
FP16 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.
1. 계산공식(1): GPU 1개 당 메모리 용량 x 0.5 = 적재 가능한 모델 크기. 예) H200 메모리 용량 141GB x 0.5 = 70.5B
2. 계산공식(2): 적재할 LLM 크기 x 2 byte (FP16은 파라미터 당 2byte 할당) = 필요 메모리 용량. 예) 20B x 2 = 40GB
3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.
4. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#03. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP8 기준)
FP8 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.
1. 계산공식(1): GPU 1개 당 메모리 용량 x 1 = 적재 가능한 모델 크기. 예) H200 메모리 용량 141GB x 1 = 141B
2. 계산공식(2): 적재할 LLM 크기 x 1 byte (FP8은 파라미터 당 1byte 할당) = 필요 메모리 용량. 예) 20B x 1 = 20GB
3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.
4. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#04. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP4 기준)
FP4 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.
1. 계산공식(1): GPU 1개 당 메모리 용량 x 2 = 적재 가능한 모델 크기. 예) B200 메모리 용량 180GB x 2 = 360B
2. 계산공식(2): 적재할 LLM 크기 x 0.5 byte (FP4는 파라미터 당 0.5byte 할당) = 필요 메모리 용량. 예) 20B x 0.5 = 10GB
3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.
4. 실행 불가 또는 미 지원(H100, H200, A100, L40S는 FP4 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
추론에 적합한 LLM 선택, 질문이 더 있으세요?
질문, 요청 등 메세지를 남겨주시면 빠르게 답변 드립니다.
대략적인 가격은 탑재수량별 GPU 서버 가격 페이지를 참고 바랍니다.
퀀텀브릭스는 고객사 및 파트너의 AI 비지니스를 지원합니다.