top of page

AI 추론 시, 적재할 수 있는 LLM 모델 크기 비교 및 선택

AI 추론 시, FP32, FP16, FP8, FP4 기준으로, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 파라미터 크기를 비교합니다.

추론 시, 적재 가능한 LLM 모델 크기는?

LLM 추론 시, 적재할 수 있는 LLM 모델의 크기는 해당 GPU 제품의 메모리 용량 크기를 기준으로 결정됩니다.

서비스 하고자 하는 크기의 LLM 모델을 적재할 수 없거나 부족할 경우, 서비스 자체를 제공할 수 없습니다. 따라서, 모델의 크기를 축소하거나 구조의 최적화를 통해 필요 메모리의 요구량을 낮추는 전략이 필요합니다.

또는, GPU를 업그레이드 하거나, 추가로 탑재하면 원하는 크기의 모델을 적재할 수 있습니다.

퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

엔비디아 H200 x 8장이 탑재된 NVIDIA HGX H200 x 8GPU 보드

#이미지: 엔비디아 H200 x 8장이 탑재된 NVIDIA HGX H200 x 8GPU 보드

#01. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP32 기준)

FP32 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.

1. 계산공식(1): GPU 1개 당 메모리 용량 x 0.25 = 적재 가능한 모델 크기. 예) B200 메모리 용량 180GB x 0.25 = 45B

2. 계산공식(2): 적재할 LLM 크기 x 4 byte (FP32는 파라미터 당 4byte 할당) = 필요 메모리 용량. 예) 20B x 4 = 80GB

3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.

4. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, GPU 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#02. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP16 기준)

FP16 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.

1. 계산공식(1): GPU 1개 당 메모리 용량 x 0.5 = 적재 가능한 모델 크기. 예) H200 메모리 용량 141GB x 0.5 = 70.5B

2. 계산공식(2): 적재할 LLM 크기 x 2 byte (FP16은 파라미터 당 2byte 할당) = 필요 메모리 용량. 예) 20B x 2 = 40GB

3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.

4. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#03. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP8 기준)

FP8 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.

1. 계산공식(1): GPU 1개 당 메모리 용량 x 1 = 적재 가능한 모델 크기. 예) H200 메모리 용량 141GB x 1 = 141B

2. 계산공식(2): 적재할 LLM 크기 x 1 byte (FP8은 파라미터 당 1byte 할당) = 필요 메모리 용량. 예) 20B x 1 = 20GB
 

3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.

4. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#04. AI 추론 시, 적재할 수 있는 LLM 모델 크기 (FP4 기준)

FP4 정밀도 기준으로, 추론 시, NVIDIA GPU 1장에 적재할 수 있는 LLM 모델의 크기를 비교합니다.

1. 계산공식(1): GPU 1개 당 메모리 용량 x 2 = 적재 가능한 모델 크기. 예) B200 메모리 용량 180GB x 2 = 360B

2. 계산공식(2): 적재할 LLM 크기 x  0.5 byte (FP4는 파라미터 당 0.5byte 할당) = 필요 메모리 용량. 예) 20B x 0.5 = 10GB

3. 수치는 이론 상이며, 실제로 적재할 수 있는 LLM 크기는 최소 10%, 최대 30% 더 작습니다.

4. 실행 불가 또는 미 지원(H100, H200, A100, L40S는 FP4 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

추론에 적합한 LLM 선택, 질문이 더 있으세요?

질문, 요청 등 메세지를 남겨주시면 빠르게 답변 드립니다.

대략적인 가격은 탑재수량별 GPU 서버 가격 페이지를 참고 바랍니다.

퀀텀브릭스는 고객사 및 파트너의 AI 비지니스를 지원합니다.

AI 서비스(추론)에 적합한 GPU 서버 견적서가 필요하세요?

최단 24시간, 최대 48시간 이내 (영업일 기준) 견적서를 보내 드립니다.

NVIDIA 루빈(Rubin), B300, B200, H200, L40S 등 모든 GPU 서버를 합리적인 가격으로 공급합니다.

퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

​자주 묻는 질문(FAQs)

bottom of page