AI Hardware Fit — 내 GPU에서 돌아가는 AI 모델 찾기
본문 바로가기
30초 시작<br>지금 알고 있는 것 하나만 고르세요<br>선택한 작업에 필요한 화면만 열고, 다음에 누를 버튼까지 안내합니다.
처음 사용 가이드
GPU가 이미 있어요<br>GPU 선택 → 실행 가능한 모델 추천<br>입력 1개 · 약 10초
실행할 모델을 알아요<br>모델 선택 → 예산에 맞는 GPU 추천<br>입력 2개 · 약 20초
AI 서비스를 만들 거예요<br>서비스·사용자 수 → 전체 장비 간편 견적<br>3단계 · 약 1분
커뮤니티 데이터<br>실측 결과 제보 · 벤치마크 데이터 현황<br>제보형 · 선택 사항
60초 체험 입력 없이 결과부터 확인하세요<br>RTX 3060 모델 추천<br>Qwen 32B용 GPU 찾기<br>사내 RAG 30명 견적<br>써보고 불편한 점 보내기
고급 도구
여러 모델 함께 배치<br>LLM·RAG·VLM·음성 모델을 여러 GPU에 배치
내 상황에 맞는 시작점
질문으로 찾기
GPU는 있는데 뭘 돌릴 수 있는지 궁금하다면 GPU 이름만 선택하면 바로 실행할 수 있는 모델 3개를 보여줍니다.입력 1개 · 약 10초
실행할 모델은 정했는데 어떤 GPU가 필요한지 모른다면 실행할 모델과 예산을 고르면 적합한 GPU를 비교합니다.입력 2개 · 약 20초
여러 사람이 함께 쓸 AI 서비스를 만들 계획이라면 챗봇, RAG, 이미지, 음성 등 서비스와 사용자 수만 입력합니다.3단계 · 약 1분
직접 계산은 필요 없고 다른 사람이 측정한 데이터만 보고 싶다면 실행 결과를 공유하거나 벤치마크 데이터 현황을 확인합니다.제보형 · 선택 사항
모르는 전문 용어는 상세 설정을 열기 전에는 입력하지 않아도 됩니다.
찾는 GPU나 모델이 없나요?
1 이름 중복 확인2 공식 출처 확인3 데이터 검토4 다음 릴리스 반영
요청 전에 검색창에서 별칭까지 확인합니다. 새 항목은 공식 제품·모델 링크가 있으면 더 빠르게 검토할 수 있습니다.
내 GPU를 선택하면 바로 계산을 시작합니다
VRAM과 대역폭을 기준으로 실행 가능한 AI 모델과 예상 속도를 바로 계산합니다.
다른 GPU 검색
찾는 GPU가 아직 목록에 없나요?<br>직접 사양을 입력해 바로 계산하거나, 이름을 채운 상태로 추가 요청을 보낼 수 있습니다.
직접 사양 입력<br>GPU 추가 요청
내 GPU
내 실행 환경<br>GPU를 선택해 주세요<br>GPU 프리셋을 선택하면 추천을 시작합니다.
선택 즉시 현재 환경에 맞는 모델을 계산합니다.
상세 설정<br>AI 스택 배치
기본 하드웨어
VRAM
시스템 RAM
GPU 수
노트북 TGP
보조 GPU 선택
GPU 모델
사용 안 함
수량
서로 다른 GPU를 함께 쓰는 경우 메모리 분할·통신 손실을 보수적으로 반영합니다.
메모리 보정
대역폭 GB/s
사용 중 VRAM
안전 여유분
고급 도구
Hugging Face 공개 LLM 직접 계산
모델 주소 또는 ID
가중치 정보 가져오기<br>불러온 모델 지우기
Hugging Face 공개 API의 생성형 LLM safetensors 파라미터 수와 config를 사용합니다. 비공개·접근 승인 필요 모델은 불러올 수 없습니다.
여러 모델 함께 돌리기<br>AI 스택 배치 플래너
LLM·임베딩·리랭커·OCR/VLM을 보유 GPU에 나눠 배치합니다.
사용 가이드
처음에는 균형형으로 시작하세요
RAG·문서 AI·여러 LLM 중 가까운 구성을 선택합니다.
보유 GPU와 동시에 실행할 모델을 확인합니다.
운영 방식과 목표 동시 사용자를 정합니다.
배치 계산 후 병목과 세 가지 대안을 비교합니다.
파이프라인한 요청이 여러 모델을 순서대로 사용
독립 서비스모델마다 별도 API와 사용자를 운영
순차 실행설치해 두고 한 번에 하나만 실행
결과는 계산 추정치입니다. 실제 운영 전에는 내 환경에서 검증하세요.
모델 찾기로 돌아가기
처음이라면 여기서 시작하세요<br>AI 스택을 GPU에 배치해 보세요
보유 GPU와 함께 실행할 모델을 선택하면 GPU별 배치, 권장 동시 접속, 예상 처리량, 병목과 개선 방법을 계산합니다.
RAG 기본 구성<br>LLM + 임베딩 + 리랭커
문서 AI 구성<br>LLM/VLM + OCR + 임베딩
여러 LLM 서비스<br>여러 모델을 독립 API로 운영
AI 아바타 채팅<br>STT + LLM + TTS + 아바타 영상
직접 선택<br>원하는 GPU와 모델을 직접 구성
1하드웨어
2모델 선택
3운영 목표
4배치 결과
하드웨어 보유한 GPU와 수량을 입력하세요.
보유 GPU 목록
+ GPU 추가
모델 선택 검색하거나 워크로드 종류를 골라 함께 실행할 모델을 추가하세요.
동시에 띄울 모델 검색 후 클릭해서 선택 (여러 종류 섞어서 선택 가능)
생성형 LLM<br>임베딩<br>리랭커<br>OCR·VLM<br>아바타<br>STT<br>TTS
선택된 모델
운영 목표 기본 목표 세 가지만 선택하면 계산할 수 있습니다.
운영 방식
파이프라인<br>독립 서비스<br>대체 모델(순차 실행)
배치 기준
균형 우선<br>모델 수 우선<br>처리량 우선<br>주 모델 우선
목표 동시 사용자
설정 안 함<br>1명<br>2명<br>4명<br>8명<br>16명<br>32명<br>64명<br>직접
주 모델(우선 배정)
지정 안 함
세부 조건
최소 VRAM 여유율
10%<br>15%<br>20%<br>직접
양자화·정밀도 자동 변경 허용<br>컨텍스트 자동 축소 허용<br>독립 서비스 모델 복제 허용
배치 계산<br>3개 배치안 비교
배치 결과 결론과 배치안을 먼저 보고, 필요할 때 계산 상세를 펼치세요.
계산 상세 보기
빠른 추천<br>전체 모델 탐색
생성형 LLM<br>임베딩<br>리랭커<br>OCR<br>문서 VLM<br>범용 VLM<br>이미지 생성<br>비디오 생성<br>아바타·립싱크<br>음성 인식<br>음성 합성
컨텍스트 토큰
4K<br>8K<br>16K<br>32K<br>64K<br>128K<br>256K<br>512K<br>1M<br>직접
동시 요청
1명<br>2명<br>4명<br>8명<br>16명<br>32명<br>64명<br>직접
평균 출력 토큰
256 토큰<br>512 토큰<br>1K 토큰<br>2K 토큰<br>4K 토큰<br>8K 토큰<br>직접
KV cache
FP16/BF16<br>FP8<br>Q8<br>Q4
양자화
실행 방식
llama.cpp / Ollama<br>vLLM<br>Transformers
평균 입력 길이
128 토큰<br>256 토큰<br>384 토큰<br>512 토큰<br>1K 토큰<br>2K 토큰<br>4K 토큰<br>8K 토큰<br>32K 토큰<br>직접
배치 크기
1개<br>8개<br>16개<br>32개<br>64개<br>128개<br>256개<br>직접
정밀도
실행 방식
Sentence Transformers<br>TEI<br>ONNX / OpenVINO<br>PyTorch 직접 실행
최대 배치 토큰
8K<br>16K<br>32K<br>64K<br>128K<br>직접
질의 길이
32 토큰<br>64 토큰<br>128 토큰<br>256 토큰<br>직접
문서 길이
256 토큰<br>512 토큰<br>1K 토큰<br>2K 토큰<br>4K 토큰<br>직접
후보 문서
10개<br>20개<br>40개<br>80개<br>120개<br>직접
배치 크기
1쌍<br>8쌍<br>16쌍<br>32쌍<br>64쌍<br>직접
정밀도
실행 방식
Sentence Transformers<br>TEI<br>ONNX / OpenVINO<br>PyTorch 직접 실행
문서 크기
이미지 생성 1024×1024<br>비디오 생성 832×480<br>A4 200 DPI<br>A4 300 DPI<br>웹/스크린샷 1080p<br>영수증/라벨<br>직접
이미지 너비
이미지 높이
배치 페이지
1페이지<br>2페이지<br>4페이지<br>8페이지<br>16페이지<br>32페이지<br>직접
정밀도
처리 기능
텍스트 OCR<br>레이아웃 포함<br>표/수식 포함<br>문서 파싱 전체
생성 스텝
비디오 프레임
FPS
LoRA 개수
메모리 절약
GPU 단독<br>순차 CPU 오프로딩<br>VAE 타일링
GPU 상세·비교<br>현재 GPU의 사양과 대안을 비교하세요
GPU 비교 열기
비교 GPU 1<br>비교 GPU 2<br>비교 GPU 3
GPU에 맞는 모델 3개를 바로 추천합니다
위에서 GPU를 선택하고 용도와 우선순위를 고르면 현재 워크로드의 실행 가능한 모델만 추립니다.
현재 GPU<br>GPU 선택 필요
용도
일반 대화 / 비서<br>한국어 특화<br>코딩<br>추론 / 수학<br>긴 문서 / RAG<br>이미지 / 문서 인식
우선순위
균형 잡힌 추천<br>품질 우선<br>속도 우선<br>여유 VRAM 우선
결과 링크 복사<br>요약 카드 PNG<br>RTX 3060 링크
전체 모델에서 비교하기<br>LLM과 RAG 모델 함께 배치
모델 0개
전체 등급<br>가능 이상<br>쾌적<br>잘 돌아감<br>가능<br>빡빡함<br>오프로딩<br>부적합
전체 작업<br>일반 챗봇<br>한국어<br>코딩<br>추론<br>긴 문서<br>비전/멀티모달
전체 공급사
전체 라이선스
전체 이용 조건<br>상업 이용 가능<br>조건부 상업 이용<br>비상업·연구용<br>약관 확인 필요
종합 추천<br>최고 품질<br>가장 빠른 모델<br>VRAM 여유 우선<br>한국어 모델 우선<br>코딩 모델 우선<br>파라미터 큰 순<br>최신 모델순
모델별 성능지표 시트
계산 추정, 외부 공개 참고값, 사용자 측정, 자체 측정을 근거별로 분리합니다.
벤치마크 데이터 준비 중
지표로 비교할 모델 선택