오늘의 AI 뉴스 / NVIDIA
NVIDIA

엔비디아 Vera Rubin, 첫 MLPerf 추론 성능에서 무엇을 보여줬나

엔비디아 Vera Rubin NVL72가 MLPerf Inference v6.1 미리보기 제출에서 이전 GB300 NVL72보다 최대 3.7배 높은 처리량을 기록했다. 칩 성능뿐 아니라 랙 연결과 추론 소프트웨어를 함께 최적화한 결과다.

원문 제목: NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

첫 MLPerf 결과에서 나온 수치

Qwen3-VL의 오프라인·서버·대화형 시나리오에서 Vera Rubin NVL72는 GB300 NVL72보다 최대 3.7배 높은 처리량을 보였다. DeepSeek-R1에서는 TensorRT-LLM을 사용해 최대 2.5배 높은 처리량을 기록했다고 엔비디아는 밝혔다.

하드웨어보다 넓은 시스템 경쟁

성능 향상에는 Tensor Core와 Transformer Engine, NVFP4 정밀도, 프리필과 디코드를 분리하는 추론 구조, NVLink 기반 랙 연결이 함께 작용했다. GB300 NVL72 4개 랙·288개 GPU 구성은 단일 랙 대비 99%의 확장 효율을 보였고, v6.0 이후 소프트웨어 최적화만으로 일부 작업 성능이 최대 1.6배 높아졌다.

  • Qwen3-VL 처리량 최대 3.7배
  • DeepSeek-R1 처리량 최대 2.5배
  • 4개 랙 확장 효율 99%

벤치마크를 읽을 때 주의할 점

Vera Rubin 결과는 첫 미리보기 제출이며 특정 모델과 설정에서 측정됐다. 실제 서비스 비용과 응답 속도는 모델 크기, 품질 목표, 네트워크, 전력 조건에 따라 달라진다. 따라서 최대 배수는 모든 워크로드에 그대로 적용되는 수치로 해석하면 안 된다.

이 글은 NVIDIA 공식 원문을 확인해 한국어로 재구성했습니다. 기업이 발표한 성과 수치는 별도 표기가 없는 한 해당 기업의 자체 측정 또는 설명입니다.

NVIDIA 공식 원문에서 확인하기 ↗