ONS
도입하기
  • AI 인프라Dell Pro MaxOrcai SMS
  • AI 솔루션DifyAX Foundry
  • 블로그블로그
  • 회사소개소개연혁
AI 인프라
  • Dell Pro Max
    Dell Pro Max
  • Orcai SMS
    서버 모니터링 솔루션
AI 솔루션
  • Dify
    노코드 AI 앱 빌더
  • AX Foundry
    AI 전환을 위한 인사이트
블로그
  • 블로그
    트렌드와 인사이트
회사소개
  • 소개
    27년 인프라 전문기업
  • 연혁
    27년간의 연혁
인사이트AI Infra

AI 워크스테이션 고르는 법: 사양보다 먼저 확인해야 하는 5가지

연산 성능 1위 기기가 토큰 생성에서는 더 느릴 수 있습니다. 통합 메모리 용량과 메모리 대역폭, 개발 생태계 세 가지를 내 작업에 대입하는 순서로 정리했습니다. 기기별 사양 비교와 작업 유형별 선택지, 구매 전 확인할 세 가지까지 담았습니다.
오픈
오픈네트웍시스템 AX 연구소
Sep 22, 2026
AI 워크스테이션 고르는 법: 사양보다 먼저 확인해야 하는 5가지
Contents
로컬 LLM 장비 구매, 어떤 걸 고려해야 할까?메모리 용량에 따라 돌릴 수 있는 모델은 어디까지일까?왜 같은 기기에서도 벤치마크가 제각기 다를까?주요 AI 워크스테이션 살펴보기DGX Spark와 Dell Pro Max GB10은 무엇이 다를까?조립 PC나 클라우드가 더 낫지 않을까?작업 유형에 따른 선택지 훑어보기그러면 구매 전에 무엇을 확인해야 할까?자주 묻는 질문메모리 128GB면 2,000억 파라미터 모델이 정말 다 올라가나요?Mac Studio가 토큰 생성은 더 빠른데 왜 GB10을 고려하나요?DGX Spark를 직접 사면 더 저렴하지 않나요?벤치마크 수치를 받으면 무엇을 확인해야 하나요?두 대를 묶으면 성능도 두 배가 되나요?전문가 혼합 모델(MoE)은 파라미터가 커도 빠르다던데 사실인가요?출처출처

직답 요약

내게 맞는 로컬 LLM 장비를 고르기는 쉽지 않습니다. 대역폭, 통합 메모리 용량, 개발 생태계를 함께 고려해야 하기 때문입니다. 연산 성능이 가장 높은 기기가, 오히려 토큰 생성에서는 더 느릴 수 있습니다. 생성 속도의 상한선을 정하는 것이 연산이 아니라 메모리 대역폭이기 때문입니다. 그래서 내가 돌릴 모델의 크기, 그리고 그 모델을 어떤 학습·추론 코드로 돌릴까를 제일 먼저 정해야 합니다.

책상 위에서도 LLM을 돌릴 수 있는 장비가 최근에 여럿 나왔습니다. 업계의 관심이 커지면서 여러 장비의 특징을 분석한 자료와 사용기가 쏟아졌습니다. NVIDIA DGX Spark와 Dell Pro Max with GB10이 같은 GB10 슈퍼칩을 탑재해 2025년 10월 15일에 함께 출시되면서 먼저 자리를 잡았습니다. 그 이후 AMD 가속기를 쓴 미니 워크스테이션도 출시되었고, Mac Studio는 통합 메모리를 계속 키워 오면서 로컬 추론 업무에서 자리를 제법 잡았습니다. 여러 장비 사이에서 스펙만 비교하면 내게 맞는 장비를 간단히 고를 수 있을 것 같습니다. 하지만 여러 가지 작업에 직접 써 보면, 스펙 순위와 체감 속도 순위가 다른 경우가 자주 생깁니다.

오픈네트웍시스템이 도입 상담에서 가장 자주 받는 질문도 '어떤 AI 워크스테이션이 현재 시장에서 제일 빠른 장비냐'는 것입니다. 이 질문에 바로 답하기 어려운 이유는 하려는 작업에 따라 ‘빠르다’의 기준이 달라지기 때문입니다. 어떤 장비가 누군가에는 최고의 선택이고, 다른 사람에게는 돈을 낭비한 선택이 되는 일이 심심치 않게 발생합니다.

이유는 간단합니다. AI 워크스테이션의 성능은 하나의 숫자가 아니라 모델 크기, 메모리, 추론 방식, 소프트웨어 호환성, 사용 패턴의 '조합'으로 결정되기 때문입니다. 이 글에서는 특정 제품의 순위를 매기기보다, 내 작업에 맞는 장비를 고르는 순서를 정리합니다. 끝까지 읽으면 후보를 2~3개로 좁히고, 벤치마크나 견적서에서 무엇을 확인해야 하는지 판단할 수 있습니다.

로컬 LLM 장비 구매, 어떤 걸 고려해야 할까?

결론부터 말씀드리면 통합 메모리 용량, 메모리 대역폭, 그리고 개발 생태계 이렇게 세 가지입니다. 세 요소를 내 작업에 하나씩 대입해 보고, 제일 적합한 조합을 결정해야 합니다. 앞에서 예시로 든 장비들 가운데서, 특정한 모델이 이 세 항목에서 모두 동시에 1위인 경우는 없습니다. 그래서 더욱 꼼꼼히 살펴보아야 합니다.

(1) 통합 메모리 용량은 어떤 모델을 올릴 수 있는지를 정합니다.

모델 가중치가 메모리에 다 들어가지 않으면 나머지를 시스템 메모리나 디스크로 밀어내야 하고, 그 순간 속도는 몇 배로 떨어집니다. 대역폭이 아무리 높아도, 모델 전체를 메모리에 올릴 수 없다면 효용이 크게 낮아집니다. 이 때문에 장비를 고를 때는 대개 속도보다 통합 메모리 용량을 먼저 봅니다.

(2) 메모리 대역폭은 토큰 출력 속도를 정합니다.

언어 모델이 토큰 하나를 출력할 때마다 그 토큰에 관여하는 가중치를 메모리에서 전부 읽어 와야 합니다. 그래서 '초당 몇 GB를 읽어 오느냐'가 그대로 '초당 몇 토큰을 처리할 수 있느냐'로 이어집니다. 연산 장치가 아무리 빨라도 데이터가 제때 도착하지 않으면 연산 장치는 기다릴 수밖에 없습니다. 이를 메모리에 묶인 상태라고 부릅니다. 사람이 앉아서 답을 기다리는 대화형 추론은 거의 언제나 이 상태이므로, 연산 성능이 아무리 좋더라도 결국 실제 체감 속도는 대역폭이 정합니다.

(3) 개발 생태계는 공개된 구현체가 내 장비에서 그대로 도는지를 정합니다.

개발 생태계가 맞지 않으면 이런 일이 생깁니다. 공개된 학습 코드와 논문 구현체 대부분이 CUDA를 전제로 쓰여 있습니다. 그래서 다른 가속기에서는 포팅이 필요하고, 특정 연산자가 아예 없어 실행이 막히기도 합니다. 특히 실험 재현이 주 업무인 연구자라면 성능 수치보다 개발 생태계를 우선하는 경우가 많습니다. 포팅에 드는 시간이 장비값보다 비싸지기 때문입니다.

메모리 용량에 따라 돌릴 수 있는 모델은 어디까지일까?

필요한 메모리 용량은 파라미터 수에 정밀도별 용량을 곱해 대략 계산할 수 있습니다. 4비트로 양자화하면 파라미터 하나에 약 0.5바이트가 드니, 700억 파라미터 모델이면 가중치만 35GB 안팎이 됩니다. 또한 여기에 대화 맥락을 담아 두는 캐시도 더 붙습니다. 그래서 같은 4비트라도 맥락을 길게 잡으면 여유가 빠르게 줄어듭니다. 문서를 통째로 넣고 질문하는 작업은 특히 더 그렇습니다.

통합 메모리 용량

4비트 기준 파라미터 수

고려사항

32GB

약 500억

700억은 4비트 가중치만 35GB라 메모리 용량을 초과함

96GB

약 1,500억

2,000억은 가중치만 100GB라 안 들어감

128GB

약 2,000억

대역폭이 낮으면 용량은 되는데 속도는 느림

256GB

약 4,000억

기기 두 대를 묶거나 상위 구성이 필요

이 표는 NVIDIA가 공식 사양에 적은 두 값을 양 끝에 놓고 비례를 기준으로 역산한 것 입니다. 단일 기기 128GB가 2,000억이고 두 대를 연결한 256GB가 4,050억이므로, 가중치가 쓰는 몫과 맥락 캐시가 쓰는 몫의 비율이 그 사이에서 일정하다고 보았습니다. 맥락을 아주 길게 잡으면 표에 적힌 값보다 더 줄어듭니다.

NVIDIA 공식 사양에는 GB10 계열 단일 기기로 최대 2,000억 파라미터 모델을 추론할 수 있고, 두 대를 연결하면 4,050억까지 구동할 수 있다고 적혀 있습니다. 공식 사양이 파라미터를 기준으로 제시돼 있으므로 128GB라는 용량보다, 구동 가능한 파라미터 수를 먼저 보는 편이 결정하기 쉽습니다.

전문가 혼합 모델(MoE, Mixture of Experts)은 전체 파라미터 수는 크지만 토큰 하나를 만들 때는 그중 일부만 사용합니다. 따라서 전체 파라미터 수가 같은 조밀 모델(Dense Model)보다 훨씬 빠르게 작동합니다. 다만 빨라지는 것은 속도 쪽이고 위 표의 용량 조건은 그대로 적용됩니다. 가중치 전체가 메모리에 올라가 있어야 하는 것은 같기 때문입니다. 그래서 파라미터 총량만 보고 느려서 못 쓰겠다고 판단하면 후보가 오히려 줄어드니 구조부터 확인하는 게 더 선택지가 넓어집니다.

왜 같은 기기에서도 벤치마크가 제각기 다를까?

같은 기기에서, 공개된 측정값들이 초당 41토큰부터 55토큰까지 상이했던 사례도 있었습니다.

SGLang 팀은 자체 최적화 환경에서 GPT-OSS 120B의 성능이 초당 50토큰 안팎으로 나왔다고 공개했습니다. 다른 리뷰어가 Ollama 기본 환경에서 잰 생성 속도는 초당 41토큰이었고, 같은 글에 함께 실린 NVIDIA 발표치는 55토큰이었습니다(세 가지 측정값은 저마다 통제된 환경에서 측정을 했겠지만, 적어도 런타임이 서로 달랐을 뿐더러 나머지 조건은 비공개 상태입니다. 초당 41토큰의 측정값은 원문에 모델명이 명시돼 있지 않아, 다른 측정값의 환경과 같은 모델인지도 확인이 필요합니다.).

차이를 만드는 요인은 대체로 네 가지 입니다.

1. 런타임 : 같은 하드웨어라도 추론 엔진이 커널을 얼마나 잘 붙이느냐에 따라 결과가 크게 벌어집니다.

2. 양자화 방식: 4비트와 8비트는 읽어 올 데이터 양 자체가 두 배 차이 납니다.

3. 맥락 길이 : 캐시가 커질수록 매 토큰마다 읽어야 할 양이 늘어 작업이 뒤로 갈수록 느려집니다.

4. 동시 요청 수 :한 사람이 쓰는 조건과 여러 요청을 묶어 처리하는 조건을 구분해야 합니다.

그래서 장비를 고를 때 벤치마크 숫자만 단순 비교하면 안됩니다. 저희는 AI 워크스테이션에 대한 견적서를 요청 받으면, 수치를 기입하기 전에 위 네 가지를 먼저 확인합니다. 그래야 다른 기기와도 더 명확히 비교를 할 수 있고, 견적서 작성 시에도 기대하는 성능을 올바르게 반영할 수 있습니다.

주요 AI 워크스테이션 살펴보기

기기

통합 메모리

메모리 대역폭

4비트 기준 파라미터 수

개발 생태계

Dell Pro Max with GB10

128GB

273 GB/s

약 2,000억 (2대 약 4,050억)

CUDA · DGX OS

NVIDIA DGX Spark

128GB

273 GB/s

약 2,000억 (2대 약 4,050억)

CUDA · DGX OS

HP Z2 Mini G1a

128GB

256 GB/s

약 2,000억

ROCm · HIP · Windows

Mac Studio M3 Ultra 96GB

96GB

819 GB/s

약 1,500억

Core ML · MLX

Mac Studio M3 Ultra 256GB

256GB

819 GB/s

약 4,000억

Core ML · MLX

구동 가능 급은 GB10 계열만 제조사 표기이고 나머지는 앞 절 기준으로 용량에서 계산한 값입니다. 출처는 항목마다 다릅니다. DGX Spark의 128GB와 273 GB/s와 최대 파라미터는 NVIDIA 공식 사양이고, Dell Pro Max with GB10은 같은 GB10 칩에 같은 메모리 구성이라는 근거로 같은 값을 적었습니다. HP Z2 Mini G1a의 128GB와 256 GB/s는 공개 리뷰에 실린 테스트 구성 값인데, 오픈네트웍시스템 비교 자료에는 대역폭이 212 GB/s로 적혀 있어 제조사 공식 표기와 대조가 필요합니다. Mac Studio의 대역폭과 메모리 구성은 오픈네트웍시스템이 공개 자료를 정리한 값입니다. 개발 생태계 열은 각 제조사가 공개한 기본 개발 환경 표기이고, 국내 판매가는 별도 문의라 표에 넣지 않았습니다.

위 표를 사람들이 보면 반사적으로 수치를 바탕으로 성능을 비교하기 쉽지만, 대역폭과 파라미터만 단순 비교해서는 1순위를 꼽기 어렵습니다.

Mac Studio를 먼저 예시로 들어보겠습니다. 대역폭이 세 배 가까이 높아 같은 모델의 토큰을 더 빠르게 생성합니다. 다만 96GB 구성은 GB10 계열보다 구동 가능한 모델 크기가 작습니다. GB10 계열은 2,000억 파라미터까지 구동할 수 있지만 대역폭이 낮아 초당 토큰 수에서는 앞서지 못합니다. 256GB 구성까지 올리면 메모리 크기 쪽에서도 순위가 바뀌어서, 어느 기기가 이겼다고 말할 수 있는 자리가 애초에 없습니다.

GB10 계열은 데이터센터에서 검증한 코드를 수정 없이 옮겨 돌리는 것이 강점입니다. 데이터센터 GPU와 같은 CUDA 환경을 쓰고 NVIDIA가 DGX OS와 소프트웨어 묶음을 함께 얹어 내놓기 때문입니다. 그래서 프로토타입을 만들어 나중에 큰 장비로 올릴 계획이 있는 팀에 맞습니다.

HP 쪽은 Windows 환경을 함께 쓰는 팀에 유리하지만, 생태계가 갈려 있어 공개 구현체를 그대로 쓰지 못하는 경우를 감수해야 합니다.

Mac Studio는 응답 속도가 필요한 대화형 작업과 이미 macOS로 개발하는 팀에서 값어치가 크고 메모리 구성을 크게 올릴 수 있다는 점도 강점입니다.

DGX Spark와 Dell Pro Max GB10은 무엇이 다를까?

결론부터 얘기하면, 칩과 메모리는 같지만 판매 채널과 사후 지원이 다릅니다.

둘 다 GB10 슈퍼칩을 쓰고 있으며, NVIDIA 공식 사양 기준으로 128GB 통합 메모리에 273 GB/s 대역폭이며 최대 구동 모델도 같습니다. 이 외에 NVIDIA 사양표는 전원 240W에 무게 1.2kg으로 적혀 있는 반면 Dell 코리아 사양표는 280W 어댑터에 1.31kg으로 적혀 있습니다. 세부 표기가 갈리므로 견적을 볼 때 어느 쪽 제품인지 먼저 확정하셔야 합니다.

가격 차이가 있습니다. 미국 기준으로 NVIDIA가 파는 DGX Spark 파운더스 에디션은 4,699달러이고, Dell Pro Max with GB10은 같은 4TB 구성이 5,654달러 남짓입니다.

다만 이 가격은 최근에 한 번 움직였습니다. NVIDIA는 2026년 2월 23일에 파운더스 에디션 정가를 3,999달러에서 4,699달러로 올렸고 128GB LPDDR5X 메모리 수급을 이유로 들었습니다. 그 전 값을 기준으로 비교한 자료를 보고 계시다면 차액이 실제보다 크게 잡혀 있을 수 있습니다. 같은 메모리 수급 문제가 양쪽에 걸려 있으므로 견적을 받으실 때는 두 제품 모두 그 시점의 값으로 다시 확인하시는 편이 좋습니다.

연구 일정이 촉박하고 장비 한 대에 실험 전체를 의존하는 상황이라면, 일종의 보험료라고 생각하고 더 비싸더라도 국내 지원이 확실한 제품을 선택하는게 좋습니다. 이 경우의 좋은 점은 국내 재고기준 제품 납기, 국내 정품 유통망을 통한 구매이력 유지 및 제품 현장 서비스 지원, 그리고 개봉 즉시 쓸 수 있는 환경 사전 세팅입니다. 한편 여건이 될 경우 다른 선택지도 있습니다. 환경 세팅을 직접 할 수 있고, 일정이 여유있고, 현장 지원을 받을 일이 적은 팀이라면 이러한 지원 대신 더 저렴한 옵션을 선택할 수 있습니다. 이 선택은 도입하고자 하는 팀이 현재 상황에 맞게 융통성 있게 결정하면 됩니다.

조립 PC나 클라우드가 더 낫지 않을까?

전용 AI 워크스테이션이 항상 정답은 아닙니다. 조립 PC와 클라우드는 특정한 상황에서는 분명히 더 나은 선택입니다. 그래서 어느 쪽이 우월하다기보다 돌릴 모델의 크기와 장비를 켜 두는 시간을 따져봐야 합니다.

조립 워크스테이션부터 먼저 보겠습니다. 고성능 소비자용 GPU를 얹은 조립 워크스테이션은, 전용 그래픽 메모리를 써서 대역폭이 높은 편입니다. 그래서 모델이 그래픽 메모리에 들어가기만 하면, 질문을 넣고 답이 나오기까지가 이 글에 있는 선택지 중 가장 빠릅니다.

문제는 '메모리에 들어가기만 하면'이라는 그 조건입니다. 2026년 8월 현재 최상위 수준의 소비자용 카드는 32GB로 알려져 있습니다. 4비트로 양자화한 700억 파라미터는, 이미 가중치만 35GB라 들어갈 수 없습니다. 맥락까지 담으려면 500억 파라미터 아래여야 여유가 생깁니다.

1,200억 이상을 다룰 계획이라면 카드를 여러 장 꽂아야 하는데 그 순간 전력과 소음과 공간이 연구실에서 감당하기 어려운 수준으로 올라가고 카드 사이를 오가는 지연도 새로 생깁니다.

클라우드 GPU는 성격이 정반대 입니다. 데이터센터급 카드를 시간 단위로 빌리는 방식이라 세 가지가 다릅니다.

  • 초기 비용이 들지 않습니다.

  • 큰 모델도 바로 올릴 수 있습니다.

  • 필요할 때만 켜서 씁니다.

공개된 시세를 보면 H100 한 장은 시간당 1.49달러에서 6.98달러 사이에 형성돼 있고 중앙값은 약 3.31달러입니다. 하루 사용 시간에 월 가동일과 시세를 곱해 월 임대료를 구한 뒤, 장비값을 그 월 임대료로 나누면 몇 달째에 비용우위가 바뀌는지가 나옵니다.

하루 사용 시간

월 임대료

역전 시점

4시간 × 월 20일

37만 원 남짓

스물한 달쯤

12시간 × 월 20일

111만 원

일곱 달쯤

전제는 이렇습니다. 장비값은 Dell Pro Max 미국 정가 5,654달러를 환율 1,400원으로 환산한 약 790만 원, 시세는 중앙값인 시간당 3.31달러 곧 약 4,630원입니다.

간헐적으로 쓰는 팀은 빌리는 쪽이 거의 언제나 쌉니다. 매일 길게 돌리는 팀이라면 역전 시점이 사용 시간에 따라 일곱 달에서 두 해 사이로 나옵니다.

다만 이 계산은 급이 다른 두 장비를 사용 시간만으로 비교한 것입니다. 장비값도 국내 실판매가가 아니라 미국 정가를 환산한 가정치이므로 그대로 견적에 쓰기는 어렵습니다. 이 표를 그대로 쓰기보다, 실제로 돌릴 모델을 먼저 정하고 그 모델이 요구하는 클라우드 사양으로 다시 계산하시는 편이 낫습니다. 그래야 품의 자료로 쓸 수 있는 숫자가 나옵니다.

데이터를 밖으로 내보낼 수 없는 환경이면 클라우드는 애초에 선택지에서 빠집니다. 그러면 로컬 장비끼리만 비교하면 됩니다. 망분리와 온프레미스 조건을 먼저 정리하시려면 온프레미스·망분리 편을 함께 보시면 됩니다. 온프레미스·망분리 편

작업 유형에 따른 선택지 훑어보기

운영할 모델의 크기를 먼저 고려한 후 장비를 고르는 순서가 시행착오가 적습니다.

같은 장비를 두고도 '빠르다'가 세 가지로 갈리기 때문입니다. 질문을 넣고 첫 글자가 나올 때까지의 시간, 그 뒤 초당 이어지는 토큰 수, 그리고 동시에 몇 건을 받아내는지입니다. 사람이 화면 앞에서 기다리는 작업은 첫 글자까지의 시간이 체감을 정하고, 긴 문서를 만들어 내는 작업은 앞에서 본 대로 메모리 대역폭이 상한을 정합니다. 여러 명이 한 장비를 나눠 쓰는 환경에서는 한 건의 속도보다 대기열이 비용이 됩니다. 아래 표는 이 세 가지를 실제 업무에 대입한 것입니다.

작업 유형

무엇이 먼저 걸리나

확인사항

후보군

사내 문서를 물어보는 챗봇을 만들어 팀에 열어 줌 (약 300억 급)

첫 글자까지의 시간

사용하려는 모델의 4비트 가중치 크기가 맥락까지 포함해 32GB 안에 들어가는지

확인사항을 체크 후, 모델이 다 들어갈 수 있다면 고성능 GPU 한 장을 얹은 워크스테이션이 좋습니다. 이 글에서 다룬 선택지 중 응답이 가장 빠릅니다

최신 공개 모델을 그대로 올려 성능을 재현해야 함 (2,000억 급 이상)

용량

제조사가 표기한 최대 구동 파라미터 수

128GB 이상 구성으로 선택지가 좁혀집니다. GB10 계열과 Mac Studio 256GB 구성이 주요 후보고, HP Z2 Mini G1a도 용량은 되고, 이와 함께 생태계 조건을 고려하면 됩니다.

논문 구현체를 받아 학습 코드를 그대로 돌려야 함

개발 생태계

쓰려는 라이브러리가 그 가속기를 공식 지원하는지 여부

CUDA 계열로 좁혀집니다. 지원 목록에 없다면 이식에 드는 시간을 장비값에 더해 계산하셔야 합니다

임상·금융 데이터라 밖으로 내보낼 수 없음

조건 자체

망분리 정책과 반출 승인 절차

클라우드가 빠집니다. 로컬 장비 안에서만 고르되 오프라인 설치가 되는 구성인지 함께 봐야 합니다

연구원 여러 명이 한 장비를 나눠 씀

대기열

동시에 실험을 돌리는 인원수

대기 시간이 성능보다 큰 비용이 됩니다. 인원이 늘수록 큰 장비 한 대보다 개인 장비를 여러 대 두는 구성이 실제 처리량에서 앞설 수 있습니다

그러면 구매 전에 무엇을 확인해야 할까?

사양 비교 시에는 단번에 안 보이지만, 도입 일정에 제일 중요한 것은 다음 세 가지 입니다.

  • 납기: 데이터센터급 AI 장비는 리드타임이 긴 편입니다. 연구 과제 일정이나 학기 일정에 맞추려면 계약 전에 재고 상황부터 확인해야 합니다

  • 보증 기간: Dell 코리아 공식 사양에는 기본 하드웨어 서비스가 1년으로 적혀 있고 2년과 3년은 지원 계약을 올려야 붙습니다. 오픈네트웍시스템을 통해 도입하시면 기본 3년으로 제공됩니다. 고가 장비를 몇 년 쓸 계획이라면 이 차이가 총비용에 그대로 들어갑니다

  • 초기 세팅: 드라이버와 프레임워크 버전이 어긋나면, 받은 날 장비를 바로 쓰지 못할 수 있습니다. 이 문제로 며칠을 쓰는 경우가 실제로 자주 생기곤 합니다

도입 상담에서는 이 세 가지를 중점적으로 함께 논의합니다. 어느 구성으로 언제 받을 수 있는지, 보증을 몇 년으로 잡을 것인지, 어떤 환경으로 맞춰 납품할 것인지를 견적 단계에서 함께 확정해 두면 나중에 다시 신경을 쓰는 일이 크게 줄어듭니다. 저희가 도입 상담을 진행할 때는 품의 자료가 필요하다면, 비교 견적과 사양서를 같은 형식으로 정리해 드립니다.

자주 묻는 질문

메모리 128GB면 2,000억 파라미터 모델이 정말 다 올라가나요?

NVIDIA 공식 사양에 단일 기기 최대 2,000억 파라미터로 적혀 있습니다. 다만 어느 정밀도 기준인지는 그 표기에 없으므로 4비트로 양자화한 경우를 전제로 보는 편이 안전합니다. 맥락을 길게 잡으면 캐시가 더 필요하므로 실제 여유는 그만큼 줄어들 수 있습니다.

Mac Studio가 토큰 생성은 더 빠른데 왜 GB10을 고려하나요?

'속도가 빠르냐'와 '메모리에 올라가냐'를 모두 고려해야 하기 때문입니다. 96GB 구성이면 올릴 수 있는 모델 크기의 상한이 GB10 계열보다 낮고, 구성을 올려 크기를 확보하더라도 CUDA 기반 코드를 그대로 쓰기는 어렵습니다.

DGX Spark를 직접 사면 더 저렴하지 않나요?

같은 4TB 구성에서 두 제품의 기기값만 견주면 DGX Spark 쪽이 낮습니다. 국내 정품 유통과 지원 계약 경로, 납기 확보, 세팅 후 납품까지 포함해 비교하면 결과가 달라질 수 있습니다. 오픈네트웍시스템을 통해 계약하시면 구매부터 세팅, 납품까지 함께 관리해 드립니다.

벤치마크 수치를 받으면 무엇을 확인해야 하나요?

모델명, 런타임, 양자화 비트 수, 맥락 길이 이렇게 넷입니다. 이 네 가지가 있어야 다른 기기의 수치와 비교할 수 있습니다.

두 대를 묶으면 성능도 두 배가 되나요?

용량이 늘어 더 큰 모델이 올라가는 것이지 초당 토큰 수가 두 배가 되지는 않습니다. 다만, 4,000억 급을 올리려는 목적이라면 의미가 있습니다.

전문가 혼합 모델(MoE)은 파라미터가 커도 빠르다던데 사실인가요?

토큰 하나를 만들 때 실제로 쓰이는 파라미터가 일부라서 같은 크기의 조밀 모델보다 빠릅니다. 다만 가중치 전체는 메모리에 올라가 있어야 하므로 용량 조건은 그대로 적용됩니다.

출처

출처

  • NVIDIA DGX Spark 공식 사양

  • NVIDIA, DGX Spark 출시 발표 (2025-10-13, 판매 시작 10-15)

  • NVIDIA 개발자 포럼, DGX Spark 가격 변경 공지 (2026-02-23)

  • Dell 코리아 Dell Pro Max with GB10 사양·가격

  • The Register, GB10과 Strix Halo 실측 비교

  • LMSYS, DGX Spark에서의 GPT-OSS 최적화 측정

  • DGX Spark·Mac Studio 로컬 추론 비교 측정

  • 오픈네트웍시스템 Dell Pro Max 제품 정보

Share article
Contents
로컬 LLM 장비 구매, 어떤 걸 고려해야 할까?메모리 용량에 따라 돌릴 수 있는 모델은 어디까지일까?왜 같은 기기에서도 벤치마크가 제각기 다를까?주요 AI 워크스테이션 살펴보기DGX Spark와 Dell Pro Max GB10은 무엇이 다를까?조립 PC나 클라우드가 더 낫지 않을까?작업 유형에 따른 선택지 훑어보기그러면 구매 전에 무엇을 확인해야 할까?자주 묻는 질문메모리 128GB면 2,000억 파라미터 모델이 정말 다 올라가나요?Mac Studio가 토큰 생성은 더 빠른데 왜 GB10을 고려하나요?DGX Spark를 직접 사면 더 저렴하지 않나요?벤치마크 수치를 받으면 무엇을 확인해야 하나요?두 대를 묶으면 성능도 두 배가 되나요?전문가 혼합 모델(MoE)은 파라미터가 커도 빠르다던데 사실인가요?출처출처
logo

(주)오픈네트웍시스템

경기도 의왕시 이미로 40, B동 907호 (포일동, 인덕원IT밸리)

사업자등록번호. 107-81-69444

대표이사. 박봉균

문의

ai@open-network.co.kr
📞 031-1544-0357
개인정보 처리방침
© OPEN NETWORK SYSTEM CO., LTD. All rights reserved.