top of page

Full 파인튜닝 및 LoRA 학습 시, 각 정밀도 별, 적재 가능한 LLM 모델 크기 비교

NVIDIA GPU 제품별로, LLM 풀 파인 튜닝 및 LoRA 학습 시, 적재 가능한 LLM 모델 크기를 비교합니다.

파인튜닝 시, 적재 가능한 LLM 크기는?

풀 파인 튜닝 및 LoRA 학습 시, 적재 가능한 최대 LLM 모델의 크기는 해당 GPU 제품의 메모리 용량을 기준으로 산출됩니다.

FP32, FP16, FP8 및 NVIDIA GPU 1장 기준으로 풀 파인 튜닝 시, 적재 가능한 최대 LLM 모델의 크기를 비교하고,

더불어, FP32, FP16, FP8 및 GPU 1장 기준으로 LoRA 학습 시, 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

AI R&D 및 프로젝트에 적합한 GPU 서버 및 인프라 구축에 참고 바랍니다.

퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

Rubin GPU 8장이 탑재된 NVIDIA HGX Rubin 메인 보드 전면 이미지

#이미지: 엔비디아 루빈(Rubin) 8장이 탑재된 HGX Rubin x 8 GPU 보드

#01. FP32 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP32 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. 계산공식: 모델 파라미터 수(B) × 36 (파라미터 4byte + 기울기 4byte + 최적화 상태 28byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 36 = 적재 가능 최대 LLM 모델 크기

2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 등으로 메모리 요구량을 낮추거나, ​상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#02. FP16 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP16 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. 계산공식: 모델 파라미터 수(B) × 18 (파라미터 2byte + 기울기 2byte + 최적화 상태 14byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 18 = 적재 가능 최대 LLM 모델 크기

2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 등을 통해 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#03. FP8 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP8 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. 계산공식: 모델 파라미터 수(B) × 9 (파라미터 1byte + 기울기 1byte + 최적화 상태 7byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 9 = 적재 가능 최대 LLM 모델 크기

2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 안정적인 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

3. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 ​또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#04. FP32 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP32 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. ​계산공식: 모델 파라미터 수 x 6 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 5배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 6 = 적재 가능 최대 LLM 모델 크기

2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

​​

3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#05. FP16 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP16 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. 계산공식: 모델 파라미터 수 x 3 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 2배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 3 = 적재 가능 최대 LLM 모델 크기

2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등 메모리 요구량을 낮추는 전략을 선택할 수 있습니다.​ 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

#06. FP8 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표

FP8 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.

1. 계산공식: 모델 파라미터 수 x 1.5 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 0.5배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 1.5 = 적재 가능 최대 LLM 모델 크기

2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.​

3. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.

4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.

적재 가능한 LLM 파라미터 크기, 질문이 더 있으세요?

질문, 요청 등 메세지를 남겨주시면 빠르게 답변 드립니다.

대략적인 가격은 탑재수량별 GPU 서버 가격 페이지를 참고 바랍니다.

퀀텀브릭스는 고객사 및 파트너의 AI 비지니스를 지원합니다.

AI 프로젝트에 적합한 GPU 서버 견적서가 필요하세요?

최단 24시간, 최대 48시간 이내 (영업일 기준) 견적서를 보내 드립니다.

AI R&D, 고객사 프로젝트, 제안 입찰 참가 등 다양한 AI 비지니스에 적합한 GPU 서버 견적서를 제공합니다.

퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

​자주 묻는 질문(FAQs)

bottom of page