파인튜닝 시, 적재 가능한 LLM 크기는?
풀 파인 튜닝 및 LoRA 학습 시, 적재 가능한 최대 LLM 모델의 크기는 해당 GPU 제품의 메모리 용량을 기준으로 산출됩니다.
FP32, FP16, FP8 및 NVIDIA GPU 1장 기준으로 풀 파인 튜닝 시, 적재 가능한 최대 LLM 모델의 크기를 비교하고,
더불어, FP32, FP16, FP8 및 GPU 1장 기준으로 LoRA 학습 시, 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
AI R&D 및 프로젝트에 적합한 GPU 서버 및 인프라 구축에 참고 바랍니다.
퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

#이미지: 엔비디아 루빈(Rubin) 8장이 탑재된 HGX Rubin x 8 GPU 보드
비교표 목록
* Tip: 목록을 클릭하면 해당 비교표로 이동, TOP 버튼을 클릭하면 상단으로 올라옵니다.
#01. FP32 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP32 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수(B) × 36 (파라미터 4byte + 기울기 4byte + 최적화 상태 28byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 36 = 적재 가능 최대 LLM 모델 크기
2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 등으로 메모리 요구량을 낮추거나, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#02. FP16 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP16 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수(B) × 18 (파라미터 2byte + 기울기 2byte + 최적화 상태 14byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 18 = 적재 가능 최대 LLM 모델 크기
2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 등을 통해 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#03. FP8 기준, Full 파인 튜닝 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP8 정밀도 기준으로, 풀 파인 튜닝 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수(B) × 9 (파라미터 1byte + 기울기 1byte + 최적화 상태 7byte) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 9 = 적재 가능 최대 LLM 모델 크기
2. 실제 학습 시에는 데이터 길이나 배치 크기에 따라 메모리가 추가로 소모되므로, 안정적인 구동이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#04. FP32 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP32 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수 x 6 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 5배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 6 = 적재 가능 최대 LLM 모델 크기
2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재가 권장됩니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#05. FP16 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP16 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수 x 3 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 2배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 3 = 적재 가능 최대 LLM 모델 크기
2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등 메모리 요구량을 낮추는 전략을 선택할 수 있습니다. 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#06. FP8 기준, LoRA 학습 시, 적재할 수 있는 LLM 모델의 크기 비교표
FP8 정밀도 기준으로, LoRA 학습 시, NVIDIA GPU 1장에 적재 가능한 최대 LLM 모델의 크기를 비교합니다.
1. 계산공식: 모델 파라미터 수 x 1.5 (기초 모델 적재 1배수 + LoRA 어댑터 및 학습 리소스 0.5배수) = 필요 메모리 용량(GB) 또는, GPU 메모리 용량 나누기(÷) 1.5 = 적재 가능 최대 LLM 모델 크기
2. 실제 구동 시에는 학습 데이터와 가동 리소스에 따른 여유 메모리가 필요하므로, 안정적인 학습이 가능한 실제 모델 크기는 표기된 수치보다 대략 10% 에서 20% 정도 더 작을 수 있습니다.
3. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘려 원하는 크기의 LLM 모델을 적재할 수 있습니다.
4. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
적재 가능한 LLM 파라미터 크기, 질문이 더 있으세요?
질문, 요청 등 메세지를 남겨주시면 빠르게 답변 드립니다.
대략적인 가격은 탑재수량별 GPU 서버 가격 페이지를 참고 바랍니다.
퀀텀브릭스는 고객사 및 파트너의 AI 비지니스를 지원합니다.