
NVIDIA Vera Rubin NVL72 공개! AI 에이전트 시대를 위한 새로운 성능 기준 제시
AI 산업이 단순한 챗봇을 넘어 AI 에이전트(Agentic AI) 시대로 빠르게 전환되고 있습니다.
이러한 변화 속에서 NVIDIA가 차세대 AI 인프라인 Vera Rubin NVL72의 성능을 공개했습니다.
이번 발표에서 가장 눈길을 끈 부분은 에이전틱 AI 워크로드 기준 최대 30배 높은 메가와트당 처리량과 100만 토큰당 비용 최대 35배 절감이라는 결과입니다.
AI 서비스를 운영하는 기업 입장에서는 성능은 물론 운영 비용까지 크게 줄일 수 있는 차세대 플랫폼이라는 평가를 받고 있습니다.

AI 활용 설정
사진 설명을 입력하세요.
AI 에이전트 시대에는 왜 새로운 성능 기준이 필요할까?
기존 AI는 질문 하나에 답하는 형태가 대부분이었습니다.
하지만 AI 에이전트는 다릅니다.
예를 들어 투자 분석을 수행하는 AI 에이전트는
- 기업 재무 데이터 분석
- 최신 뉴스 검색
- 공시자료 확인
- 경쟁사 비교
- 가치평가 수행
- 여러 하위 AI 에이전트 호출
- 결과 종합 및 보고서 작성
등 여러 단계를 스스로 수행합니다.
이 과정에서 입력과 출력 토큰이 계속 누적되며 일반 챗봇보다 훨씬 긴 컨텍스트를 처리해야 합니다.
실제로 OpenRouter 데이터에 따르면 에이전틱 AI는 일반 채팅보다 약 15배 많은 토큰을 사용하는 것으로 나타났습니다.
Vera Rubin NVL72, 얼마나 빨라졌을까?
NVIDIA가 공개한 자료에 따르면 실제 에이전틱 코딩 작업을 기반으로 한 벤치마크에서 Vera Rubin NVL72는 기존 GB300 NVL72보다 크게 향상된 성능을 기록했습니다.
주요 성능은 다음과 같습니다.
- 메가와트당 AI 처리량 최대 30배 향상
- 100만 토큰당 비용 최대 35배 절감
- 동일한 전력으로 훨씬 많은 AI 에이전트 동시 운영 가능
- 장시간 추론과 긴 컨텍스트 처리 성능 강화
특히 AI 팩토리처럼 전력 사용량이 중요한 데이터센터에서는 동일한 전력으로 훨씬 많은 AI 서비스를 운영할 수 있다는 점이 가장 큰 장점으로 꼽힙니다.

AI 활용 설정
사진 설명을 입력하세요.
실제 AI 서비스 운영 비용도 크게 절감
AI 서비스를 운영하는 기업에게 가장 중요한 요소는 결국 비용입니다.
토큰 비용이 낮아질수록 AI 서비스를 더 많은 사용자에게 제공할 수 있고, 운영 수익성도 높아집니다.
Vera Rubin NVL72는 100만 토큰당 비용을 최대 35배 절감해 AI 에이전트를 대규모로 운영하는 기업들의 부담을 크게 줄여줄 것으로 기대됩니다.
NVIDIA가 강조한 핵심 기술
이번 성능 향상의 배경에는 하드웨어와 소프트웨어를 함께 최적화한 NVIDIA의 공동 설계(Co-Design) 전략이 있습니다.
대표적인 기술은 다음과 같습니다.
분리형 서빙(Disaggregated Serving)
AI가 데이터를 읽는 과정과 답변을 생성하는 과정을 분리해 각각 최적의 속도로 처리합니다.
분산 KV 캐싱
긴 대화에서 이미 계산한 정보를 다시 계산하지 않고 저장해 재활용함으로써 처리 속도를 높입니다.
KV 인식 라우팅
관련 데이터를 보유한 GPU로 작업을 보내 불필요한 연산을 줄입니다.
MegaMoE
MoE(Mixture of Experts) 모델에서 GPU 간 통신을 최적화해 전체 처리량을 크게 향상시키는 기술입니다.
NVFP4 양자화
모델을 4비트 정밀도로 압축하면서도 성능 저하를 최소화해 메모리 사용량과 처리 속도를 동시에 개선했습니다.
NVLink 6세대도 성능 향상에 기여
Vera Rubin NVL72에는 최신 NVLink 6세대 기술도 적용됐습니다.
NVIDIA에 따르면 기존 범용 Ethernet 기반 연결 방식보다
- 최대 10배 높은 패킷 처리율
- 최대 3배 낮은 지연시간
을 제공해 GPU 간 데이터 전송 속도를 크게 높였습니다.
AI 에이전트처럼 여러 GPU가 동시에 협업해야 하는 환경에서 큰 장점으로 작용합니다.
AI 팩토리를 위한 7칩 아키텍처
Vera Rubin 플랫폼은 GPU 하나만 업그레이드한 제품이 아닙니다.
NVIDIA는 AI 팩토리를 위해 다음과 같은 구성 요소를 하나의 플랫폼으로 설계했습니다.
- Vera CPU
- Rubin GPU
- Groq 3 LPU
- NVLink 6 Switch
- BlueField-4 DPU
- Spectrum-6 SPX
- ConnectX-9 SuperNIC
이처럼 하드웨어 전체를 하나의 시스템으로 최적화해 AI 에이전트의 성능을 극대화하는 것이 핵심 전략입니다.
AI 인프라 경쟁은 이제 '에이전트' 중심
최근 AI 시장은 단순한 생성형 AI에서 스스로 계획하고 실행하는 AI 에이전트 중심으로 빠르게 변화하고 있습니다.
이러한 변화 속에서 긴 컨텍스트 처리와 대규모 추론 성능은 앞으로 AI 인프라 경쟁의 핵심 요소가 될 전망입니다.
NVIDIA의 Vera Rubin NVL72는 이러한 흐름에 맞춰 성능과 전력 효율, 운영 비용까지 모두 개선한 차세대 AI 플랫폼으로 주목받고 있습니다.
마무리
Vera Rubin NVL72는 단순히 GPU 성능을 높인 제품이 아니라 AI 에이전트 시대를 위한 새로운 인프라 기준을 제시했다는 점에서 의미가 큽니다.
최대 30배 향상된 전력 대비 처리 성능과 최대 35배 절감된 토큰 비용은 AI 서비스를 운영하는 기업들에게 매우 중요한 경쟁력이 될 것으로 보입니다.
앞으로 AI 산업이 에이전트 중심으로 더욱 빠르게 성장할 것으로 예상되는 만큼, NVIDIA의 차세대 플랫폼이 시장에 어떤 변화를 가져올지 관심이 집중되고 있습니다.
📌 태그
#NVIDIA #엔비디아 #VeraRubin #RubinNVL72 #GB300 #Blackwell #AI #인공지능 #AIAgent #AI에이전트 #AgenticAI #생성형AI #GPU #AI인프라 #데이터센터 #NVLink #TensorCore #CUDA #AI팩토리 #AI뉴스 #반도체 #테크뉴스 #엔비디아뉴스
'뉴스' 카테고리의 다른 글
| 드디어 폴더블 아이폰 나오나? 애플, 아이폰18 프로·첫 폴더블 공개 임박 (0) | 2026.08.26 |
|---|---|
| 해리 왕자·메건 마클 영국 복귀 앞두고 논란…가정부 구인난 이유는? (0) | 2026.08.26 |
| 한국 조선업 비상? 컨테이너선 발주 80% 중국행…대만도 돌아섰다 (0) | 2026.08.25 |
| 이재명 대통령 "늘어난 재정 여력은 미래를 위한 씨앗" (0) | 2026.08.25 |
| 갤럭시 S27 울트라, 후면 디자인 대폭 변경될까? (1) | 2026.08.25 |