RAG 시스템 구축 시, 적합한 GPU 선택 기준은?
RAG 시스템 구축 시, FP32, FP16, FP8, FP4 정밀도 기준으로 NVIDIA GPU 1장 및 100M(1억) 파라미터 임베딩 모델을 기반으로, 대용량 문서 전처리 및 벡터 변환(Embedding) 속도를 비교하고,
더불어, FP32, FP16, FP8, FP4 정밀도 기준으로, NVIDIA GPU 2장 또는 8장 및 70B 모델 기준으로 동시에 접속이 가능한 사용자 수를 비교합니다.
AI R&D 및 프로젝트에 적합한 GPU 서버 및 인프라 구축에 참고 바랍니다.
퀀텀브릭스는 합리적인 가격으로 GPU 서버를 공급합니다.

#이미지: Rubin(루빈) x 8장이 탑재된 NVIDIA HGX Rubin x 8 GPU 보드
비교표 목록
* Tip: 목록을 클릭하면 해당 비교표로 이동, TOP 버튼을 클릭하면 상단으로 올라옵니다.
#01. RAG 시스템 구축 시, 임베딩 처리 속도 (FP32 기준)
NVIDIA GPU 1장, FP32 정밀도 및 100M(1억) 파라미터 임베딩 모델을 기준으로, 대용량 문서 전처리 및 벡터 변환(Embedding) 속도를 비교합니다.
1. 계산식: TPS = (FP32 TFLOPS × 10¹²) ÷ (2 × 100,000,000) = (GPU 초당 총 FLOPS) ÷ (토큰 1개당 필요 FLOPs)
2. 예시(H200): (60 × 10¹²) ÷ (2 × 10⁸) = (6 × 10¹³) ÷ (2 × 10⁸) = 3 × 10⁵ = 300,000 tokens/s
3. TPS 수치는, GPU가 중단 없이 100% 풀 가동된다는 가정하에 이론상 최대 수치이며, 실제로는 이론치의 30~60% 수준입니다.
4. FP32 연산 성능은 Dense 기준이며, TF32 / Sparse 를 활용하는 임베딩 모델 기준으로는 더 빠르고 높습니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#02. RAG 시스템 구축 시, 임베딩 처리 속도 (FP16 기준)
NVIDIA GPU 1장, FP16 정밀도 및 100M(1억) 파라미터 임베딩 모델을 기준으로, 대용량 문서 전처리 및 벡터 변환(Embedding) 속도를 비교합니다.
1. 계산식: TPS = (FP16 PFLOPS × 10¹⁵) ÷ (2 × 100,000,000)
2. 예시(H200): (1.6 × 10¹⁵) ÷ (2 × 10⁸) = (1.6 × 10¹⁵) ÷ (2 × 10⁸) = 8 × 10⁶ = 8,000,000 tokens/s
3. GPU가 중단 없이 100% 풀 가동된다고 가정하에 이론상 최대 수치이며, 실제로는 이론치의 30~60% 수준입니다.
4. FP16 연산 성능은 Sparse 기준이며, Dense 기준으로는 50%의 성능을 보입니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#03. RAG 시스템 구축 시, 임베딩 처리 속도 (FP8 기준)
NVIDIA GPU 1장, FP8 정밀도 및 100M(1억) 파라미터 임베딩 모델을 기준으로, 대용량 문서 전처리 및 벡터 변환(Embedding) 속도를 비교합니다.
1. 계산식: TPS = (FP8 PFLOPS × 10¹⁵) ÷ (2 × 100,000,000)
2. 예시(H200): (3.3 × 10¹⁵) ÷ (2 × 10⁸) = 1.65 × 10⁷ = 16,500,000 tokens/s
3. GPU가 중단 없이 100% 풀 가동된다고 가정하에 이론상 최대 수치이며, 실제로는 이론치의 30~60% 수준입니다.
4. A100은 FP8 미 지원 / FP16 연산 성능은 Sparse 기준이며, Dense 기준으로는 50% 성능을 보입니다.
5. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#04. RAG 시스템 운영 시, 최대 동시 접속자 수 (FP32 기준)
NVIDIA GPU 2장 또는 8장 탑재 GPU 서버 1대, FP32 정밀도 및 LLM 70B 모델 기준으로 최대 동시 접속자 수를 비교합니다.
1. 계산공식: (총 GPU 메모리 - 모델 가중치 크기) 나누기(÷) 사용자 당 KV 캐시 점유량 = 동시 접속자 수
2. 모델 가중치 크기: 모델 파라미터 수(70B) x 4 byte(FP32) = 280GB
3. B300 기준 예시: (총 메모리 2,304GB - 모델 가중치 크기 280GB) 나누기(÷) 사용자 당 KV 캐시 점유량 1GB = 2,024명
4. 본 수치는 이론 상 최대이며, 실제 가동 시에는 가능한 동접자수가 최소 15% 에서 최대 40% 정도 줄어듭니다.
5. 실행 불가(H100, A100, L40S, RTX 6000은 메모리 용량 부족, LLM 적재 불가) 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘릴 수 있습니다.
6. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#05. RAG 시스템 운영 시, 최대 동시 접속자 수 (FP16 기준)
NVIDIA GPU 2장 또는 8장 탑재 GPU 서버 1대, FP16 정밀도 및 LLM 70B 모델 기준으로 최대 동시 접속자 수를 비교합니다.
1. 계산공식: (총 GPU 메모리 - 모델 가중치 크기) 나누기(÷) 사용자 당 KV 캐시 점유량 = 동시 접속자 수
2. 모델 가중치 크기: 모델 파라미터 수(70B) x 2 byte(FP16) = 140GB
3. B300 기준 예시: (총 메모리 2,304GB - 모델 가중치 크기 140GB) 나누기(÷) 사용자 당 KV 캐시 점유량 1GB = 2,164명
4. 본 수치는 이론 상 최대이며, 실제 가동 시에는 가능한 동접자 수가 최소 15% 에서 최대 40% 정도 줄어듭니다.
5. 실행 불가(L40S x 2장은 메모리 용량 부족, 적재 불가) 또는 미 지원 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘릴 수 있습니다.
6. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#06. RAG 시스템 운영 시, 최대 동시 접속자 수 (FP8 기준)
NVIDIA GPU 2장 또는 8장 탑재 GPU 서버 1대, FP8 정밀도 및 LLM 70B 모델 기준으로 최대 동시 접속자 수를 비교합니다.
1. 계산공식: (총 GPU 메모리 - 모델 가중치 크기) 나누기(÷) 사용자 당 KV 캐시 점유량 = 동시 접속자 수
2. 모델 가중치 크기: 모델 파라미터 수(70B) x 1 byte(FP8) = 70GB
3. B300 기준 예시: (총 메모리 2,304GB - 모델 가중치 크기 70GB) 나누기(÷) 사용자 당 KV 캐시 점유량 1GB = 2,234명
4. 본 수치는 이론 상 최대이며, 실제 가동 시에는 가능한 동접자수가 최소 15% 에서 최대 40% 정도 줄어듭니다.
5. 실행 불가 또는 미 지원(A100은 FP8 미 지원) 시, LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, 추가 탑재로 메모리 용량을 늘릴 수 있습니다.
6. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
#07. RAG 시스템 운영 시, 최대 동시 접속자 수 (FP4 기준)
NVIDIA GPU 2장 또는 8장 탑재 GPU 서버 1대, FP4 정밀도 및 LLM 70B 모델 기준으로 최대 동시 접속자 수를 비교합니다.
1. 계산공식: (총 GPU 메모리 - 모델 가중치 크기) 나누기(÷) 사용자 당 KV 캐시 점유량 = 동시 접속자 수
2. 모델 가중치 크기: 모델 파라미터 수(70B) x 0.5 byte(FP4) = 35GB
3. B300 기준 예시: (총 메모리 2,304GB - 모델 가중치 크기 35GB) 나누기(÷) 사용자 당 KV 캐시 점유량 1GB = 2,269명
4. 본 수치는 이론 상 최대이며, 실제 가동 시에는 가능한 동접자수가 최소 15% 에서 최대 40% 정도 줄어듭니다.
5. 실행 불가 또는 미 지원 시(H100, H200, A100, L40S는 FP4 정밀도 미 지원), LLM 모델 축소, 구조 최적화 또는 정밀도 변경 등으로 메모리 요구량을 낮추거나 또는, 상위 버전으로 GPU를 업그레이드 하거나, GPU 추가 탑재로 메모리 용량을 늘릴 수 있습니다.
6. 탑재수량별 GPU 서버 가격표 | 실시간 문의하기 | 48시간 내 견적서 제공 서비스를 참고 바랍니다.
RAG 시스템 구축에 적합한 GPU 서버, 질문이 더 있으세요?
문의, 질문, 요청 등 메세지를 남겨주시면 빠르게 답변 드립니다.
대략적인 가격은 탑재수량별 GPU 서버 가격 페이지를 참고 바랍니다.
퀀텀브릭스는 고객사 및 파트너의 AI 비지니스를 지원합니다.