techcrunch 통신에 따르면 AI 반도체 시장을 둘러싼 경쟁의 무게중심이 개별 GPU 성능에서 데이터센터 전체의 효율을 높이는 '시스템 경쟁'으로 이동하고 있다. 그동안 최첨단 GPU를 앞세워 AI 인프라 시장을 주도해 온 Nvidia가 CPU와 네트워킹, 스토리지 등 GPU 주변 인프라까지 경쟁력을 확대하면서 새로운 진입장벽을 구축하고 있다는 분석이 나온다.TechCrunch에 따르면 Nvidia는 AI 산업 초기 최첨단 GPU의 핵심 공급자로 자리 잡으며 급성장했지만, 최근 Amazon과 Google 등 하이퍼스케일러가 자체 AI 칩 개발을 확대하면서 GPU 시장에서 경쟁 압력이 높아졌다. 이에 따라 시장에서는 Nvidia의 독보적인 지위가 얼마나 오래 지속될 수 있을지를 놓고 논의가 이어져 왔다.
그러나 최근 Nvidia의 실적 발표 이후 시장의 관심은 GPU 자체를 넘어선 인프라 경쟁력으로 확대되는 모습이다. AI 데이터센터의 컴퓨팅 규모가 기가와트 수준으로 커질수록 수많은 프로세서와 메모리, 스토리지 사이에서 데이터를 효율적으로 이동시키는 작업이 중요해지고 있기 때문이다.Nvidia가 내세우고 있는 핵심 전략 가운데 하나는 Vera Rubin 아키텍처다. Rubin GPU를 중심으로 Vera CPU와 네트워킹·스토리지 등 데이터센터 운영에 필요한 여러 요소를 결합해 대규모 AI 컴퓨팅 환경의 효율성을 높이는 방식이다.개별 GPU가 AI 연산을 수행하는 '엔진'이라면 CPU와 스토리지, 네트워킹 시스템은 이 엔진이 최대 성능을 낼 수 있도록 지원하는 나머지 차량 구성요소에 가깝다.특히 Vera CPU는 대규모 AI 시스템의 데이터 오케스트레이션 문제를 해결하는 역할에 초점을 맞춘다.Jason Hardy Nvidia 스토리지 기술 부사장은 TechCrunch와의 인터뷰에서 단일 서버나 컴퓨팅 플랫폼에 탑재할 수 있는 메모리 용량에는 한계가 있기 때문에 Vera의 역할이 중요하다고 설명했다.

AI 데이터센터 규모가 커지면서 메모리 수요 역시 급증하고 있다. 하지만 메모리와 스토리지 용량을 확대하는 것만으로 AI 시스템의 성능을 극대화할 수 있는 것은 아니다. 필요한 데이터를 적절한 시점에 GPU로 전달하지 못하면 고성능 GPU가 대기하는 병목현상이 발생할 수 있기 때문이다.특히 AI 기업들이 같은 전력으로 더 많은 토큰을 처리하는 ‘와트당 토큰’ 효율을 높이는 데 집중하면서 데이터 이동과 트래픽 관리 기술의 중요성이 더욱 커지고 있다.Hardy는 Vera CPU를 활용한 가속을 통해 관련 작업에서 3배 이상의 개선을 확인했으며, 플래시 스토리지 성능도 병목현상 없이 더욱 효과적으로 활용할 수 있게 됐다고 밝혔다.이 같은 문제는 Nvidia만 해결하려는 것이 아니다. OpenAI 역시 자체 AI 칩 Jalapeño를 개발하면서 데이터 이동과 통신 지연을 줄이는 데 초점을 맞췄다.
OpenAI는 이달 공개한 자료에서 Jalapeño를 데이터 이동과 통신 지연을 최소화하는 방향으로 설계했다고 밝혔다. 전체 워크로드를 하나의 연결된 시스템 안에서 처리하도록 함으로써 데이터 이동량을 줄이고 AI 요청을 처음부터 끝까지 빠르고 효율적으로 처리한다는 전략이다.Nvidia가 CPU와 GPU, 스토리지 및 네트워킹을 유기적으로 연결해 데이터 이동을 최적화하는 방향이라면 OpenAI는 보다 통합된 칩과 시스템 내부에서 작업을 처리해 데이터 이동 자체를 줄이는 접근법을 취하고 있는 셈이다.방식에는 차이가 있지만 목표는 같다. 단순히 프로세서의 연산 횟수를 늘리는 데 집중하는 것이 아니라 데이터가 어디로, 얼마나 빠르게 이동하는지를 최적화해 AI 시스템 전체의 처리 효율을 높이는 것이다.AI 인프라 시장의 이러한 변화는 새로운 경쟁 영역을 만들고 있다. 앞으로 AI 반도체 경쟁에서는 개별 GPU나 AI 가속기의 연산 성능뿐 아니라 CPU, 메모리, 스토리지, 네트워킹, 냉각 및 전력까지 포함한 전체 시스템의 효율이 중요한 평가 기준으로 부상할 가능성이 크다.
특히 초대형 AI 데이터센터에서는 수많은 가속기를 동시에 운영해야 하는 만큼 개별 칩의 성능이 높더라도 데이터 이동이나 메모리, 네트워크에서 병목현상이 발생하면 전체 시스템 효율이 떨어질 수 있다.이는 Nvidia에 새로운 기회인 동시에 새로운 경쟁을 의미한다. GPU 시장에서 경쟁 반도체 업체와 맞붙는 것에 더해 앞으로는 자체 AI 인프라를 구축하는 하이퍼스케일러들과 시스템 수준에서도 경쟁해야 하기 때문이다.다만 현재까지는 GPU를 비롯해 CPU와 네트워킹, 소프트웨어 및 데이터센터 인프라를 폭넓게 구축해 온 Nvidia가 시스템 단위 AI 인프라 경쟁에서도 앞서 있다는 평가가 나온다.결국 AI 인프라 경쟁의 핵심 질문도 달라지고 있다. ‘누가 가장 빠른 GPU를 만드는가’에서 ‘누가 수많은 AI 가속기를 가장 효율적으로 하나의 시스템처럼 작동하게 만드는가’로 경쟁의 범위가 확대되고 있다.












