레이블이 맥북 AI인 게시물을 표시합니다. 모든 게시물 표시
레이블이 맥북 AI인 게시물을 표시합니다. 모든 게시물 표시

2026년 8월 4일 화요일

AI 파라미터 이해 — 14B부터 H100 4장까지

AI 모델을 고를 때 7B, 14B, 70B 같은 숫자를 자주 봅니다. 이 숫자는 모델이 학습한 파라미터(parameter)의 개수입니다. 숫자가 크면 보통 더 많은 패턴과 지식을 표현할 여지가 있지만, 답변 품질·속도·메모리가 숫자 하나로 결정되지는 않습니다. AI 서버의 GPU 병목GPU 클라우드 비용을 함께 보면 이 숫자가 왜 인프라 비용으로 이어지는지도 이해하기 쉽습니다.

파라미터와 가중치는 무엇인가

신경망은 입력을 다음 층으로 전달하면서 수많은 곱셈과 덧셈을 합니다. 이때 학습으로 조정되는 숫자가 파라미터입니다. 가중치(weight)는 연결마다 곱해지는 핵심 파라미터를 가리키는 말이고, 편향·임베딩·정규화 값 등도 넓은 의미의 파라미터에 포함됩니다. 일상적인 설명에서는 두 단어를 거의 같은 뜻으로 쓰지만 완전히 같은 개념은 아닙니다.

모델의 “크기”는 대개 파라미터 수로 말합니다. 하지만 실행에 필요한 메모리는 파라미터 수 × 숫자 정밀도로 먼저 계산해야 합니다.

저장 형식 파라미터 1개에 필요한 대략적인 메모리 70B 가중치만 계산한 값
FP16/BF16 2바이트 약 140GB
INT8 1바이트 약 70GB
4비트 양자화 0.5바이트 약 35GB

실제 VRAM에는 가중치 외에도 KV 캐시(긴 대화 기억), 실행 버퍼, 프레임워크 오버헤드와 여유 공간이 필요합니다. 그래서 “70B가 4비트면 35GB”는 하한선이지 35GB GPU에서 항상 쾌적하다는 뜻이 아닙니다. 컨텍스트 길이와 동시 사용자 수가 늘면 필요한 메모리도 커집니다.

필자의 부족한 지식으로 예를 들자면 파라미터는 인간의 뇌의 용량(연결된 뉴런의 갯수라고 표현해야 할까요?), 가중치는 학습시 우선시 학습하는 카테고리 정도로 이해하면 편할 듯합니다.

NVIDIA H100 데이터센터 GPU의 검은색 보드와 중앙 칩

<NVIDIA H100 공식 이미지. H100 제품 사양은 80GB HBM3 메모리와 94GB H100 NVL을 구분해 제시합니다. 출처: NVIDIA>

파라미터 크기별 현실적인 실행선

아래 표는 “모델을 띄울 수 있느냐”를 가중치 메모리와 일반적인 추론 여유 공간을 기준으로 보수적으로 나눈 것입니다. 양자화 방식, 컨텍스트, CUDA·Metal 커널, 모델 구조에 따라 결과가 달라지므로 절대적인 컷오프가 아닙니다.

하드웨어 실사용을 기대할 수 있는 범위 해석
RTX 5090 32GB 7B14B는 편안함, 20B27B는 4비트 중심 30B 이상은 저컨텍스트·오프로딩 없이는 부담
H100 80GB 1장 30B 전후 BF16, 70B 4비트 40B BF16은 가중치만 약 80GB라 실사용 여유가 없음
H100 80GB 4장 70B BF16은 충분, 100B~120B는 배치·컨텍스트에 따라 가능 150B 이상은 설계와 메모리 분할을 따져야 함
H100 80GB 4장, 300B급 일반적인 Dense BF16은 불가 300B는 BF16 가중치만 약 600GB. MoE도 전체 가중치는 저장해야 함

NVIDIA도 H100 NVL을 Llama 2 70B용으로 소개하며 188GB HBM 구성을 제시합니다. 이 자료는 “70B는 80GB 한 장에 BF16으로 넉넉히 들어간다”는 식의 주장을 반박하는 실제 제품 사례입니다. 70B 4비트는 한 장에서 가능할 수 있지만, BF16 70B는 H100 NVL처럼 메모리를 합친 구성이 더 자연스럽습니다.

RTX 5090은 32GB GDDR7이라 개인용 양자화 모델의 현실적인 상한을 넓혀줍니다. 다만 14B와 30B의 체감 속도 차이는 모델 파일 크기뿐 아니라 메모리 대역폭과 커널 최적화에도 좌우됩니다. 서버에서는 GPU 여러 장의 VRAM을 단순히 더하는 것만으로 끝나지 않고, NVLink·PCIe 통신과 텐서 병렬화 비용이 생깁니다.

M4 맥북에서 돌려볼 만한 오픈 웨이트 모델

필자가 사용하는 M4 맥북 프로 48GB 통합 메모리에서는 운영체제와 앱이 메모리를 함께 사용합니다. 따라서 48GB 전부를 모델에 할당할 수 없습니다.

  • 8B~14B 4비트·8비트: Qwen3 8B/14B, Llama 3.1 8B, Gemma 3 12B, DeepSeek-R1-Distill-Qwen-14B가 가장 무난한 출발점입니다.
  • 20B~32B 4비트: 실행은 가능할 수 있지만 긴 컨텍스트와 빠른 응답을 동시에 기대하기 어렵습니다. 코딩·추론용은 같은 크기라도 양자화 품질을 확인해야 합니다.
  • 70B 4비트: 48GB 맥북에서는 파일 크기와 런타임 여유를 생각하면 일반적인 추천이 아닙니다. 128GB 통합 메모리 상위 맥이라도 노트북다운 속도와 안정성을 보장하지 않습니다.

설치 방법은 Ollama, LM Studio, MLX가 진입장벽이 낮습니다. 맥북 로컬 AI의 장점은 최고 성능보다 개인 문서가 외부 서버로 나가지 않는 통제력과 낮은 진입비용에 있습니다. M4 세대의 통합 메모리 구성은 Apple의 MacBook Pro 사양에서 확인할 수 있습니다.

검은색 화면을 보여주는 MacBook Pro M4 정면 제품 이미지

<MacBook Pro M4 공식 제품 이미지. 통합 메모리는 CPU와 GPU가 공유하므로 모델에 전부 사용할 수 없습니다. 출처: Apple>

GPU 가격은 왜 체감이 다른가

2026년 8월 초 확인 가능한 공개 자료를 보면 소비자 GPU와 데이터센터 GPU의 가격 체계가 완전히 다릅니다.

GPU·구성 확인 가능한 가격 기준 주의점
GeForce RTX 5090 공식 출시가 1,999달러, 최근 시장 보도 약 4,288달러 재고와 지역에 따라 크게 변동
H100 업계 가격 자료 약 2.5만~4만달러 NVIDIA의 일반 소비자 MSRP가 아닌 시장 추정치
H100 클라우드 공개 온디맨드 비교 약 시간당 3.85~12.29달러 지역·예약·호스트·네트워크에 따라 다름
HGX B200 8-GPU 서버 2026년 시장 추정 약 40만~50만달러 GPU 한 장 소매가가 아니라 완성 서버 가격

RTX 5090의 MSRP와 실제 판매가는 NVIDIA 공식 제품 페이지Tom’s Hardware의 시장 추적처럼 나누어 봐야 합니다. H100은 NVIDIA 공식 사양Google Cloud의 GPU 가격표를 함께 보면, 구매가와 시간당 임대료를 혼동하지 않을 수 있습니다. H100을 집에 사는 것보다 필요한 시간만 클라우드에서 빌리는 편이 대부분의 개인에게 현실적입니다.

결론: 개인용 에이전트의 방향성

파라미터 수는 모델의 잠재적인 표현 용량을 보여주지만, 실제 사용성은 정밀도·양자화·컨텍스트·메모리 대역폭·소프트웨어 최적화까지 합쳐서 결정됩니다. 지금은 M4 48GB에서 8B~14B 모델 정도가 한계로 보입니다. 그래도 이정도로 집에서 돌려볼 수 있게된 현실게 감사할 따름이죠. H100 1장은 70B 양자화, H100 4장은 70B BF16부터 현실성이 높아집니다. 뭐 그래도 일반인들이 집에서 돌리기에는 무리가 있죠.

나의 한줄은 이렇습니다. 어서 빨리 내 집 컴퓨터에 개인용 모델을 설치하고, 나만 사용하는 AI 에이전트를 쓰고 싶다. 아마 미래는 모델이 더 작아지고 지능형 그래픽카드가 더 좋아지는 방향으로 발전할 것입니다. 이미 그런시대가 코앞에 와있을지 모를 일이죠. AI의 발전을 보고 있으면 매일매일을 기대하게 됩니다.

404호 개발실 28 - 비서

시리즈 · 404호 개발실 웹툰 · 연재 중 28회 · 404호 개발실 28 - 비서 AI 업무 자동화가 시작되자, 주인과 비서의 자리가 뒤집힙니다. <주인을 부리던 비서에서 AI의 비서가 된 개발실 1.1> 컷별 상황...