Nvidia의 역사: 그래픽 스타트업에서 AI 인프라 기업으로
1993년 NV1의 승부수부터 GeForce, CUDA, AlexNet, Blackwell, Rubin, 그리고 AI 우위를 뒷받침하는 풀스택 시스템까지 Nvidia의 역사를 따라가 봅니다.

Nvidia의 역사가 중요한 이유
Nvidia의 성장사는 특수 목적의 그래픽 칩이 어떻게 현대 AI 컴퓨팅의 토대가 됐는지 보여 줍니다. 이 회사는 소비자용 3D 그래픽에서 출발해 치명적일 뻔한 아키텍처 실수를 극복했고, 큰 시장이 생기기 전부터 프로그래머블 컴퓨팅 플랫폼을 만들었습니다. 이후 개별 가속기를 완전한 데이터 센터 시스템으로 발전시키는 데 오랜 시간을 들였습니다.
사람들은 지금도 서로 다른 모습의 Nvidia를 만납니다. 게이머는 GeForce 그래픽 카드, 레이 트레이싱, AI 보조 렌더링을 떠올립니다. 연구자는 과학 컴퓨팅에 쓰이는 CUDA 라이브러리와 가속기를 압니다. 클라우드 운영자는 GPU, CPU, 네트워킹, 스위치, 관리 소프트웨어를 담은 고밀도 시스템을 구매합니다. 투자자는 게임 중심이던 매출 구성이 놀랄 만큼 빠르게 AI 인프라로 옮겨간 회사를 봅니다.
이 사업들을 묶는 생각은 단순합니다. 모든 종류의 연산을 CPU가 처리할 필요는 없다는 것입니다. Nvidia는 병렬로 처리할 일이 많은 작업을 찾아 특화 프로세서를 설계하고, 이를 쓸 수 있게 만드는 소프트웨어를 함께 만들었습니다. 그래픽은 첫 대중시장이었고, 과학 컴퓨팅은 까다로운 초기 고객을 제공했으며, 딥러닝은 가속 컴퓨팅을 데이터 센터의 우선순위로 바꿨습니다.
성공은 보장되지 않았습니다. NV1은 시장 표준이 된 삼각형 기반 그래픽과 다른 방식을 택했습니다. CUDA는 눈에 띄는 매출을 내기 전까지 수년간 소프트웨어 투자가 필요했습니다. Nvidia는 기존 CPU 업체를 상대로 서버 시장에 진입했고, 69억 달러에 네트워킹 회사를 인수했으며, 확장 카드보다 훨씬 만들기 어려운 랙 단위 수랭식 시스템에 투자했습니다.
결과를 설명하는 핵심 결정은 세 가지입니다.
- Nvidia는 소프트웨어, 라이브러리, 개발자 지원을 실리콘의 부속품이 아니라 제품으로 다뤘습니다.
- 게임 시장의 물량으로 연구와 데이터 센터까지 겨냥할 수 있는 아키텍처를 개발했습니다.
- 메모리 이동과 네트워킹처럼 유효 성능을 가로막는 병목이 생길 때마다 GPU 주변으로 영역을 넓혔습니다.
칩 사양만으로는 이야기를 다 알 수 없습니다. 개발자가 프로그래밍할 수 있고, 시스템이 확장 가능하며, 고객이 운영할 수 있고, 새 세대가 기존 소프트웨어를 큰 혼란 없이 실행할 때 프로세서는 오래가는 플랫폼이 됩니다.
Nvidia의 창업과 첫 번째 잘못된 선택에서의 생존
Nvidia는 1993년 4월 5일 Jensen Huang, Chris Malachowsky, Curtis Priem이 소비자 PC에 고성능 3D 그래픽을 제공하기 위해 설립했습니다. Huang은 AMD에서 마이크로프로세서 설계를, LSI Logic에서 칩 통합을 맡은 경험이 있었습니다. Malachowsky와 Priem은 Sun Microsystems에서 그래픽과 시스템 경험을 쌓았고, Priem은 IBM에서도 일했습니다. 세 사람은 Denny's 식당에서 만나 Nvidia가 될 계획을 구상했습니다.
기회는 컸지만 시장은 정리되지 않았습니다. 전문 3D 그래픽은 주로 CAD, 시각화, 미디어 제작에 쓰는 비싼 워크스테이션에 있었습니다. 소비자 PC는 더 빠른 프로세서, CD-ROM 드라이브, 향상된 디스플레이, 성장하는 게임 시장을 얻고 있었지만 그래픽 하드웨어는 파편화돼 있었습니다. 수십 개 반도체 회사가 같은 기회를 노렸습니다.
Nvidia의 첫 제품 NV1은 1995년 Diamond Edge 3D 카드로 출시됐습니다. 2D 및 3D 그래픽, 오디오, Sega 컨트롤러 지원을 결합했습니다. 가장 중요한 설계 선택은 곡면 기반의 이차 텍스처 매핑이었습니다. 하지만 Microsoft Direct3D와 업계 전반에서는 삼각형 폴리곤 방식이 표준이 됐습니다.
NV1은 Sega의 Virtua Fighter PC판을 비롯해 자체 아키텍처용 소프트웨어를 실행할 수 있었습니다. 그러나 삼각형 기반 API가 힘을 얻자 개발자들은 작은 독점 플랫폼을 지원할 이유가 없었습니다. 기술적으로 야심 찬 칩은 플랫폼 호환성이 결정적이 된 순간 소프트웨어 부족에 부딪혔습니다.
Sega와의 협업은 흔히 NV2로 알려진 또 다른 그래픽 프로젝트로 이어졌습니다. Huang은 이 아키텍처를 계속 밀면 두 회사의 시간만 낭비한다고 판단했습니다. Sega는 콘솔 프로젝트를 끝냈지만 Nvidia가 남은 자원을 다른 방향으로 돌릴 수 있도록 재정 지원을 했습니다. 스타트업에는 더 실패할 여유가 거의 없었습니다.
후속 프로젝트는 표준, 일정, 더 좁은 제품 정의에 집중했습니다. Nvidia는 인력을 줄이고 삼각형 렌더링을 채택했으며 NV3를 Direct3D 중심으로 설계했습니다. 이 칩은 1997년 출시된 RIVA 128이 됐습니다. 첫 4개월에 100만 대 이상 판매되며 매출과 PC 제조사 신뢰를 함께 얻었습니다.
이 구조조정은 이후에도 이어진 습관을 만들었습니다. 시장이 다른 프로그래밍 표준을 선택하면 우아한 설계도 버렸습니다. 하드웨어와 드라이버를 빠른 주기로 내놓았고, 호환 게임이 없는 그래픽 프로세서는 플랫폼이 아니라 재고일 뿐이라는 점에서 개발자와 직접 협력했습니다.
Nvidia는 1998년 TSMC와 생산 관계를 맺어 팹리스 모델을 확립했습니다. 비싼 생산 공장을 직접 보유하는 대신 아키텍처, 소프트웨어, 제품 설계에 투자하고 외부 파운드리에 생산을 맡겼습니다. 이 구조는 빠른 성장을 뒷받침했지만 첨단 생산능력이 대만에 집중되면서 의존도도 더 커졌습니다.
Nvidia는 1999년 1월 주당 12달러로 IPO를 마쳤습니다. 상장이 압박을 끝내지는 않았습니다. 그래픽 세대는 빠르게 바뀌었고 드라이버 품질은 모든 제품 평가에 영향을 미쳤습니다. 3dfx, ATI, Matrox, S3 같은 경쟁사는 한 번의 강력한 제품만으로 고객을 빼앗을 수 있었습니다.
RIVA, GeForce, 그리고 PC 그래픽 경쟁
RIVA와 GeForce는 경쟁력 있는 실리콘에 꾸준한 드라이버 지원과 폭넓은 호환성을 결합해 Nvidia의 입지를 세웠습니다. RIVA 128은 NV1 실패 후 회복 가능성을 입증했고, RIVA TNT와 TNT2는 개발자들이 채택하던 API 전반에서 색 심도, 화질, 멀티텍스처링, 성능을 개선했습니다.
1990년대 후반 PC 시장에서는 이 조합이 중요했습니다. 빠른 카드도 드라이버가 충돌하거나 게임을 잘못 렌더링하거나 새 DirectX를 늦게 지원하면 실망을 안겼습니다. Nvidia는 드라이버를 지속적인 엔지니어링 책임으로 보고, 자주 업데이트해 신작 게임을 지원하고 문제를 고쳤습니다. 이 방식은 훗날 훨씬 큰 컴퓨팅 소프트웨어 스택을 관리하는 데도 도움이 됐습니다.
1999년 Nvidia는 GeForce 256을 소개하며 최초의 GPU, 즉 그래픽 처리 장치라고 홍보했습니다. 이 명칭의 소유권보다 중요한 점은 그 말이 가리킨 아키텍처 변화였습니다. GeForce 256은 하드웨어 변환과 조명을 통합해 CPU가 처리하던 기하 계산을 그래픽 프로세서로 옮겼습니다.
그 덕분에 개발자는 게임 로직, 물리, 더 풍부한 장면에 CPU 자원을 쓸 수 있었습니다. 그래픽 가속의 정의도 넓어졌습니다. 프로세서는 텍스처 픽셀을 화면에 표시하는 고정 장치에서 벗어나 세대마다 더 많은 렌더링 파이프라인을 흡수하고 소프트웨어에 더 많은 제어권을 제공했습니다.
Nvidia는 대형 PC 제조사와 게임 개발자를 통해 지위를 강화했습니다. OEM 채택으로 칩은 주류 시스템에 들어갔고, 개발자 관계 조직은 스튜디오가 GeForce에 맞춰 게임을 조정하도록 도왔습니다. Microsoft의 초기 Xbox용 그래픽 계약도 따냈고, 성능, 비용, 납기 조건이 엄격한 완전한 플랫폼을 공급하는 경험을 쌓았습니다.
경쟁은 치열했습니다. Nvidia는 2000년 초기 열성 게이머용 3D의 상징이었던 Voodoo 카드 회사 3dfx의 핵심 자산을 인수하기로 했습니다. ATI는 독립 경쟁사로 남았다가 나중에 AMD에 합류했습니다. Nvidia는 한 세대에서는 앞서가고 다음 세대에서는 흔들릴 수 있었으며, DirectX 9 시기의 GeForce FX 제품군은 그 사례입니다.
Nvidia는 더 빠른 아키텍처 수정으로 대응했습니다. GeForce 6는 경쟁력을 회복했고, 이후 세대는 통합 셰이더, 향상된 프로그래머빌리티, 증가한 부동소수점 처리량을 더했습니다. 구매자별 브랜드도 나눴습니다. 소비자용 GeForce, 전문 시각화용 Quadro, 그리고 컴퓨팅 가속기용 Tesla입니다.
그래픽은 AI로 이어지는 기술적 아이디어도 제공했습니다. 프로그래머블 셰이더는 개발자가 병렬 실행을 어떻게 쓰는지 알려 줬고, 텍스처와 프레임 버퍼 수요는 메모리 대역폭을 끌어올렸습니다. 멀티 GPU 게임은 인터커넥트와 작업 분배 경험을 쌓게 했습니다. 새 하드웨어를 내놓으면서도 오래된 게임을 지원해야 했던 일은 하드웨어 스타트업이 자주 과소평가하는 소프트웨어 호환성의 중요성을 각인시켰습니다.
Nvidia는 2018년 Turing 아키텍처와 GeForce RTX로 렌더링 모델을 새로 정비했습니다. 전용 RT Core는 광선 교차 계산을 가속했고, Tensor Core는 Deep Learning Super Sampling 같은 신경망 기법을 지원했습니다. 렌더링은 한 가지 기법에 의존하지 않고 기존 래스터화, 레이 트레이싱, 학습 기반 복원을 결합하는 방식으로 바뀌었습니다.
2025년 소개된 Blackwell 기반 GeForce RTX 50 제품군은 4세대 RT Core, 5세대 Tensor Core, 뉴럴 셰이더, DLSS 4로 이 융합을 이어갔습니다. 데이터 센터가 더 큰 사업이 된 뒤에도 게임은 AI 보조 그래픽과 로컬 모델 추론을 널리 배포하는 중요한 채널로 남았습니다.
프로그래머블 셰이더가 범용 컴퓨팅의 길을 열다
프로그래머블 셰이더는 그래픽 프로세서가 고정 렌더링 파이프라인 밖에서도 유용한 프로그램을 실행할 수 있음을 보여 주며 Nvidia의 전략을 바꿨습니다. 초기 GPU는 기하, 조명, 텍스처 적용, 픽셀 출력용 전용 단계를 갖췄습니다. 하드웨어가 특화된 만큼 빨랐지만 개발자가 바꿀 수 있는 설정은 제한적이었습니다.
2001년 출시된 GeForce 3는 프로그래머블 버텍스 셰이더를 지원했습니다. 뒤이은 세대에서 픽셀과 프래그먼트 프로그램도 더 강력해졌습니다. 게임 개발자는 맞춤형 조명, 물, 피부, 그림자, 후처리 효과에 이를 썼고, 연구자들은 같은 프로세서를 값싼 병렬 장비로 보기 시작했습니다.
초기 연구 실험은 불편했습니다. 행렬 연산을 하려는 과학자는 데이터를 텍스처로, 계산을 그리기 연산으로 표현해야 했습니다. 결과를 프레임 버퍼에 쓰고 그래픽 API로 다시 읽기도 했습니다. 하드웨어 처리량은 인상적이었지만 프로그래밍 방식은 과학 문제와 무관한 그래픽 지식을 요구했습니다.
그럼에도 이 실험은 유리한 경제 구조를 드러냈습니다. 게임 시장은 많은 산술 유닛과 고대역폭 메모리를 지닌 큰 칩에 투자할 만한 물량을 만들었습니다. 연구자는 맞춤형 과학 프로세서보다 훨씬 낮은 비용으로 그 하드웨어를 살 수 있었습니다. Nvidia가 적절한 프로그래밍 계층을 제공하면 같은 트랜지스터 투자가 엔터테인먼트와 기술 컴퓨팅을 함께 겨냥할 수 있었습니다.
Nvidia는 각 셰이더 단계에 별도 하드웨어를 배정하지 않고 프로그래머블 프로세서 그룹이 여러 단계를 처리하는 통합 셰이더 아키텍처로 옮겨갔습니다. GeForce 8과 G80 아키텍처는 이 모델을 상업적으로 중요하게 만들었습니다. 통합 풀은 그래픽 활용도를 높이고 범용 컴퓨팅에 더 규칙적인 실행 대상을 제공했습니다.
GPU 컴퓨팅은 훗날 제품 설계에 영향을 준 한계도 드러냈습니다. 병렬 하드웨어는 수천 개 실행 레인을 채울 만큼 독립적인 유사 연산이 많을 때 강합니다. 분기가 많고 직렬적인 코드는 CPU가 더 나을 수 있습니다. 작은 정보를 프로세서 메모리 사이에서 반복 이동하면 데이터 전송이 가속 이득을 없앨 수 있습니다. 메모리 용량, 대역폭, 통신이 충분하지 않으면 빠른 연산도 쓸모가 제한됩니다.
이 제약은 Nvidia가 이후 영역을 넓힌 이유입니다. CUDA는 프로그래밍을, 고대역폭 메모리는 로컬 데이터 공급을, NVLink는 프로세서 간 이동을, Mellanox 네트워킹은 서버 간 통신을 해결했습니다. 하나의 병목을 풀 때마다 다음 병목이 드러나면서 역사는 칩 밖으로 확장됐습니다.
CUDA가 GPU 하드웨어를 컴퓨팅 플랫폼으로 바꾸다
CUDA는 프로그래머에게 병렬 컴퓨팅을 위한 직접적인 모델을 제공했고, 경쟁사가 더 빠른 칩 하나만으로는 따라잡기 어려운 소프트웨어 기반을 만들었습니다. Nvidia는 2006년 아키텍처를 발표하고 2007년 첫 개발 도구를 내놓아, 개발자가 문제를 그래픽 연산으로 바꾸지 않고 C와 비슷한 커널을 작성하게 했습니다.
프로그래밍 모델은 스레드, 블록, 그리드, 공유 메모리, 디바이스 메모리를 노출했습니다. 개발자는 여전히 병렬 작업과 데이터 이동을 이해해야 했지만 수치 배열을 이미지인 척 다룰 필요는 없어졌습니다. 이 차이는 렌더링에는 관심이 없는 과학자, 엔지니어, 퀀트 개발자에게 하드웨어를 열어 줬습니다.
Nvidia는 플랫폼 도입에서 잘 보이지 않는 부분에도 투자했습니다. 컴파일러, 디버거, 프로파일러, 문서, 예제, 대학 과정, 여러 GPU 세대에 걸친 호환성입니다. 커널을 직접 쓰고 싶지 않은 사용자에게는 라이브러리가 특히 중요했습니다. cuBLAS는 최적화된 선형대수를, cuFFT는 고속 푸리에 변환을 제공했고, 이후 라이브러리는 희소 연산, 난수, 이미징, 데이터 분석 등으로 확장됐습니다.
초기 도입은 병렬 구조가 분명한 작업에서 이뤄졌습니다.
- 분자 동역학과 계산 화학
- 지진 처리와 의료 영상
- 옵션 가격 산정과 몬테카를로 시뮬레이션
- 선형대수와 과학 계산 솔버
- 신호 처리와 전산 유체 역학
성능 수치는 신중히 봐야 합니다. GPU는 특정 커널을 몇 시간에서 몇 분으로 줄일 수 있지만, 전체 애플리케이션은 입력 처리, 직렬 작업, 통신에 막힐 수 있습니다. 오래가는 이점은 모든 CPU 명령을 대체하는 장치로 보지 않고 팀이 가속기를 중심으로 전체 작업을 재구성할 때 나왔습니다.
Nvidia는 연구 지원금, 대학 프로그램, 개발자 행사, GPU Technology Conference를 통해 이를 뒷받침했습니다. 학생들은 하나의 프로그래밍 환경을 배웠고 연구자들은 그 환경으로 작성한 코드를 발표했으며, 고용주는 이미 도구에 익숙한 인력을 채용했습니다. 라이브러리에는 수년간의 최적화와 수치 테스트가 쌓였습니다.
전환 비용이 생겼지만 그것만으로 지속 사용을 설명할 수는 없습니다. 개발자는 옮기는 비용이 이득보다 크고, 현재 플랫폼이 계속 좋아질 때 남습니다. Nvidia는 하위 호환성, 폭넓은 프레임워크 지원, 최적화 라이브러리, 새 하드웨어 기능으로 여러 제품 주기에 걸쳐 이 판단을 유지했습니다.
CUDA는 Nvidia 내부도 바꿨습니다. 칩 회사는 생산이 시작되면 제품이 완성됐다고 할 수 있습니다. 컴퓨팅 플랫폼에는 지속적인 컴파일러 작업, 보안 업데이트, 라이브러리 유지보수, 새 프레임워크 지원이 필요합니다. 보드 매출은 한 번 인식되지만 소프트웨어 책임은 보드의 사용 수명 내내 이어집니다.
GPU 컴퓨팅 시장이 성숙하기 전에는 이 장기 투자가 비싸 보였습니다. AI 수요가 급증한 뒤에는 가장 강한 방어력이 됐습니다. 새 가속기 업체는 벤치마크 숫자뿐 아니라 수년간 축적된 작동 코드와 개발자 경험과 경쟁해야 했습니다.
Tesla와 데이터 센터 진출
Tesla 제품군은 디스플레이 구동용 그래픽 카드와 컴퓨팅 제품을 분리하며 Nvidia에 서버와 슈퍼컴퓨터로 가는 길을 열었습니다. 2007년 출시된 Tesla 가속기는 수치 성능, 메모리 용량, 신뢰성 기능, 고밀도 시스템 운용을 강조했습니다.
데이터 센터 구매자는 게이머와 다른 제약을 평가합니다. 지속 처리량, 오류 처리, 열 설계, 소프트웨어 지원 기간, 정비성, 클러스터 통신, 전력당 성능을 봅니다. 배정밀도 연산은 게임에는 거의 기여하지 않아도 과학 시뮬레이션에는 중요할 수 있습니다. 수천 개 장치에서 며칠 동안 계산을 돌릴 때는 오류 정정 메모리가 필수일 수 있습니다.
국립 연구소와 대학은 초기 기준 고객이 됐습니다. Oak Ridge National Laboratory의 Titan 슈퍼컴퓨터는 CPU와 Nvidia K20X 가속기를 결합해 2012년부터 연구자를 지원했습니다. Titan 같은 시스템은 GPU 가속이 워크스테이션 시연이 아니라 실제 과학용 슈퍼컴퓨터 규모에서도 운영될 수 있음을 입증했습니다.
전문 시각화도 또 하나의 다리였습니다. Quadro는 엔지니어링, 설계, 영화, 과학 조직에 Nvidia 하드웨어를 공급했습니다. AI가 가속기 클러스터를 이사회 수준의 지출로 만들기 전에, 이 관계는 인증 애플리케이션, 긴 지원 주기, 기관 구매 방식을 이해하도록 도왔습니다.
클라우드 접속은 시장을 넓혔습니다. Amazon Web Services가 GPU 인스턴스를 도입한 뒤 Microsoft Azure, Google Cloud 등도 뒤따랐습니다. 연구자와 스타트업은 서버를 구매하고 둘 공간을 찾고 드라이버를 직접 유지할 필요 없이 시간 단위로 가속기를 빌릴 수 있었습니다. 실험 비용은 낮아졌고, 성공한 프로젝트는 로컬 인프라를 다시 만들지 않고도 더 큰 용량을 요청할 수 있었습니다.
하드웨어 로드맵은 여러 아키텍처를 거쳤습니다. Kepler는 에너지 효율과 컴퓨팅 성능을 개선했습니다. Pascal은 P100을 고대역폭 메모리와 NVLink에 결합했습니다. Volta의 V100은 밀집 행렬 연산용 Tensor Core를 도입했습니다. Ampere의 A100은 혼합 정밀도와 분할 기능을 넓혔고, Hopper의 H100은 Transformer Engine과 빠른 인터커넥트로 트랜스포머 학습과 추론을 겨냥했습니다.
각 세대는 이론 처리량을 높였지만 실제 클러스터 성능은 시스템 전체에 달렸습니다. 운영자는 호환 호스트 프로세서, 스토리지, 네트워크 어댑터, 스위치, 전력, 냉각, 펌웨어, 스케줄러, 컨테이너, 모니터링을 갖춰야 했습니다. 단일 가속기가 벤치마크를 이겨도 균형이 나쁜 클러스터에서는 값비싼 프로세서가 데이터를 기다릴 수 있습니다.
이 현실은 Nvidia를 시스템 엔지니어링으로 이끌었습니다. 회사는 레퍼런스 디자인을 내고 서버 제조사와 긴밀히 협력했으며, 이후 통합 장비를 출하하기 시작했습니다. 데이터 센터 고객은 결과를 얻는 시간을 구매했고, Nvidia는 광고한 컴퓨팅 성능이 지속되는지를 결정하는 구성 요소를 점점 더 통제했습니다.
AlexNet이 딥러닝을 상업적 방향으로 만들다
AlexNet은 GPU로 학습한 신경망이 의미 있는 규모에서 기존 컴퓨터 비전 방식을 능가할 수 있음을 보여 줬습니다. 2012년 ImageNet 대회에서 Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton은 각각 3GB 메모리를 지닌 GeForce GTX 580 두 대로 약 5~6일 동안 네트워크를 학습했습니다. 오류율은 경쟁 시스템보다 훨씬 낮았고, 딥 컨볼루션 네트워크와 이를 학습한 하드웨어 모두에 관심이 쏠렸습니다.
신경망 학습은 큰 배열에서 행렬 곱, 컨볼루션, 활성화 함수, 리덕션을 반복하므로 GPU와 잘 맞습니다. 이런 연산은 많은 실행 유닛을 채울 충분한 병렬 작업을 담고 있습니다. GPU의 메모리 대역폭도 계산을 공급하는 데 도움이 됐지만, 모델 크기와 통신은 곧 새로운 한계가 됐습니다.
이 돌파구는 시연이지 완성된 상업 스택은 아니었습니다. 연구자에게는 신뢰할 수 있는 기본 연산, 프레임워크 통합, 멀티 GPU 통신, 낮은 정밀도 연산 방식이 필요했습니다. Nvidia는 신경망을 겨냥한 소프트웨어와 아키텍처 변화로 대응했습니다.
2014년 처음 나온 cuDNN은 딥러닝 연산의 최적화 구현을 제공했습니다. 프레임워크 관리자는 라이브러리를 한 번 통합하면 많은 사용자에게 맞춤 커널 작성 없이 GPU 가속을 제공할 수 있었습니다. Caffe, Theano, Torch, TensorFlow, PyTorch는 각각 추상화 수준을 개별 장치 명령에서 더 멀리 옮겼습니다.
낮은 정밀도는 학습 경제성을 바꿨습니다. 많은 신경망 연산은 64비트 부동소수점이 필요하지 않습니다. 소프트웨어가 수치 정확도를 잘 관리하면 32비트, 16비트, 8비트와 더 작은 형식을 처리하는 하드웨어는 처리량을 높이고 메모리 사용을 줄일 수 있습니다. 2017년 도입된 Volta의 Tensor Core는 이 패턴에 맞는 행렬 연산을 가속했습니다. 이후 아키텍처는 트랜스포머와 추론을 위한 형식과 제어 기능을 더했습니다.
Nvidia는 2016년 이 조각들을 DGX-1에 담았습니다. 3U 시스템은 Tesla P100 가속기 8개, NVLink 연결, 스토리지, 네트워킹, 준비된 소프트웨어 환경을 결합했습니다. 연구소는 호환 부품을 조립하고 소프트웨어 구성을 따로 해결하는 대신 통합 장비를 살 수 있었습니다.
모델은 프로세서를 파는 것에서 AI 컴퓨터를 파는 것으로 진화했습니다. HGX는 시스템 제조사에 베이스보드와 레퍼런스 플랫폼을 제공했고, DGX는 더 큰 시스템과 SuperPOD 설계로 확장됐습니다. 클라우드 제공업체는 같은 가속기 세대 기반 인스턴스를 제공했으며, 기업은 관련 소프트웨어를 자체 서버에 배포할 수 있었습니다.
트랜스포머 모델은 규모의 가치를 키웠습니다. 더 큰 언어 모델 학습에는 더 많은 연산, 가속기 메모리, 집단 통신 속도가 필요했습니다. 모델 제공은 사용자에게 토큰을 생성하는 비용과 지연 시간이라는 새 경제 지표를 만들었습니다. Nvidia는 학습 라이브러리, 통신 도구, 추론 최적화, 모델 서빙 구성 요소를 모두 갖췄기에 두 단계에 대응할 수 있었습니다.
생성형 AI는 AlexNet 이전부터 시작된 투자를 증폭했습니다. 2012년 결과는 병렬 프로세서의 고성장 응용 분야를 보여 줬고, 그보다 앞선 CUDA 투자는 응용이 도착했을 때 Nvidia를 실질적인 플랫폼으로 만들었습니다.
소프트웨어 생태계가 경쟁 해자가 되다
Nvidia의 소프트웨어 생태계는 가속기 하드웨어를 작동하는 애플리케이션으로 바꾸는 일을 줄여 줍니다. 그 가치는 하나의 독점 인터페이스가 아니라 서로 다른 문제를 푸는 여러 계층에서 나옵니다.
CUDA는 프로그래밍 기반과 런타임을 제공합니다. CUDA-X 라이브러리는 수학, 데이터 처리, 통신, 이미징, 머신러닝용 최적화 함수를 제공합니다. NCCL은 많은 GPU에 모델을 나눌 때 필요한 집단 연산을 조정합니다. TensorRT는 학습된 모델을 추론용으로 최적화하고 Triton Inference Server는 지원되는 프레임워크와 하드웨어 구성에서 모델 서빙을 관리합니다.
상위 계층은 전체 워크플로를 다룹니다. RAPIDS는 데이터 준비와 분석을 가속하고, NeMo는 생성형 모델 개발과 조정 도구를 제공합니다. NIM은 선택된 모델과 추론 구성 요소를 배포 가능한 마이크로서비스로 묶습니다. Nvidia AI Enterprise는 명확한 릴리스와 유지보수 절차를 원하는 조직에 지원 소프트웨어를 제공합니다.
실무적 이점은 누적됩니다. 프레임워크는 모든 사용자가 GPU 전문가가 되지 않아도 최적화된 커널을 쓸 수 있습니다. 라이브러리는 애플리케이션 인터페이스를 익숙하게 유지하면서도 새 아키텍처의 명령을 채택할 수 있습니다. 기업은 모든 구성 요소를 따로 시험하지 않고 지원되는 드라이버, 컨테이너, 오케스트레이션 소프트웨어, 서버 조합을 검증할 수 있습니다.
호환성이 저절로 생기지는 않습니다. 새 정밀도는 모델 정확도에 영향을 줄 수 있고 컴파일러 변경은 오래된 코드의 가정을 드러낼 수 있습니다. 드라이버, 펌웨어, 컨테이너, 프레임워크 버전은 함께 맞춰야 합니다. 예측 가능한 운용이 하드웨어 가치를 지키므로 Nvidia는 이 통합 작업에 큰 비용을 씁니다.
생태계는 파트너까지 이어집니다. 서버 제조사는 HGX와 MGX 설계 기반 시스템을 만들고, 클라우드 사업자는 GPU 인스턴스와 관리형 서비스를 운영합니다. 소프트웨어 업체는 애플리케이션을 인증하며, 컨설턴트와 시스템 통합업체는 클러스터를 배포합니다. 대학은 개발자를 양성하고 스타트업은 Nvidia 프로그램에서 기술 지원을 받습니다.
산업별 플랫폼은 같은 기반 구성 요소에 도메인 도구를 더합니다.
- DRIVE는 자동차 컴퓨팅, 시뮬레이션, 인지 소프트웨어, 개발 도구를 결합합니다.
- Isaac은 로보틱스 개발, 합성 데이터, 인지, 제어를 다룹니다.
- Clara는 의료 영상과 유전체학 등 헬스케어 및 생명과학 워크플로를 묶습니다.
- Omniverse는 OpenUSD를 중심으로 시뮬레이션과 협업 3D 워크플로를 연결합니다.
- Jetson은 로봇, 카메라, 기타 엣지 시스템용 가속기 하드웨어와 소프트웨어를 제공합니다.
이 제품들이 모든 산업에서 채택을 보장하지는 않습니다. 자동차 프로그램은 검증 주기가 길고, 의료 배포는 임상 및 규제 제약을 받습니다. 산업 시뮬레이션에는 정확한 모델과 기존 운영 데이터 통합이 필요합니다. Nvidia는 공통 컴퓨팅 기반을 제공하지만 고객과 파트너는 여전히 상당한 도메인 작업을 해야 합니다.
해자는 약해질 수도 있습니다. 오픈 프레임워크는 애플리케이션을 공급업체별 코드에서 점점 분리합니다. 컴파일러 프로젝트는 여러 가속기 유형을 겨냥할 수 있고, AMD의 ROCm도 성숙했습니다. 클라우드 회사는 맞춤 칩 위에서 자체 소프트웨어 서비스를 통제합니다. 대형 구매자는 공급 다변화나 운영비 절감을 위해 포팅 비용을 감수할 수 있습니다.
따라서 Nvidia의 방어는 그 자체를 위한 비호환성이 아니라 지속적인 유용성입니다. 회사는 라이브러리를 빠르게 유지하고 널리 쓰이는 프레임워크를 지원하며, 새 하드웨어가 빠르게 생산성을 내게 하고, 가격과 집중 위험에도 구매자가 통합 플랫폼을 선호할 만큼의 운영 가치를 제공해야 합니다.
전략적 베팅이 Nvidia를 GPU 밖으로 넓히다
Nvidia는 인접 기술이 시스템 성능을 제한하거나 새 컴퓨팅 시장을 열 때마다 그래픽 프로세서 밖으로 확장했습니다. 어떤 베팅은 핵심 사업이 됐고, 어떤 것은 기대한 결과 없이 수년의 노력을 소모했습니다.
Tegra는 Nvidia 프로세서를 휴대폰, 태블릿, 자동차, 임베디드 장치에 넣으려는 초기 시도였습니다. 휴대폰 시장은 모뎀 강점을 지닌 통합 시스템온칩 업체를 선호했고 Nvidia는 지속 가능한 우위를 갖지 못했습니다. Tegra는 자동차 시스템, Shield 제품군, 임베디드 개발 보드, Nintendo Switch 콘솔에서 더 적합한 역할을 찾았습니다.
교훈은 프로세서 성능만으로 플랫폼 경제성을 이길 수 없다는 점입니다. 전력, 무선 통합, 앱 호환성, 공급 계약, 고객 로드맵이 그래픽 성능보다 더 중요할 수 있습니다. Nvidia는 모바일 야심을 줄이고 병렬 컴퓨팅과 그래픽의 비중이 더 큰 시장에 기술을 적용했습니다.
회사는 인터커넥트 주변 기술도 개발하거나 인수했습니다. 2014년 발표되고 Pascal 시스템에 도입된 NVLink는 GPU 간 더 빠른 직접 통신과 선택된 설계에서 긴밀한 CPU-GPU 연결을 제공했습니다. NVSwitch는 서버나 랙 안에서 더 많은 가속기가 고대역폭 스위칭 패브릭으로 통신하게 했습니다.
2019년 발표돼 2020년 완료된 69억 달러 규모 Mellanox 인수는 이 통제를 데이터 센터 네트워크로 넓혔습니다. Mellanox는 InfiniBand, 고속 Ethernet, 네트워크 어댑터, 스위치, RDMA 경험을 가져왔습니다. AI 클러스터가 몇 개 가속기에서 수천 개로 커지면서 이 자산의 가치는 더 높아졌습니다.
분산 학습에서는 프로세서가 그래디언트, 파라미터, 활성화를 기다리며 멈출 수 있습니다. 저지연 네트워킹과 효율적인 집단 연산은 GPU가 실제 계산에 쓰는 시간 비율을 높입니다. Mellanox는 주변 기능이 아니라 클러스터 내 모든 가속기의 경제성을 개선했습니다.
BlueField DPU는 네트워킹, 스토리지, 보안, 인프라 작업을 호스트 CPU에서 옮겼습니다. Spectrum-X는 AI 클러스터 트래픽에 Ethernet 제품과 소프트웨어를 적용했고, Quantum 시스템은 InfiniBand 제품군을 이어갔습니다. Nvidia는 이제 랙 안 가속기 링크부터 여러 랙을 잇는 네트워크까지 컴퓨팅 패브릭을 설계할 수 있습니다.
시도된 Arm 인수는 다른 경로였습니다. Nvidia는 2020년 400억 달러 규모 제안을 발표하며 가속 컴퓨팅과 Arm의 광범위하게 라이선스되는 CPU 명령 세트 및 지식재산을 결합하려 했습니다. 고객과 규제 당국은 칩 공급업체가 Arm을 소유하면 중립적인 라이선스 지위가 훼손될 수 있다고 우려했습니다. 규제 반대로 Nvidia는 2022년 거래를 종료했습니다.
실패한 거래가 CPU 계획을 끝내지는 않았습니다. Nvidia가 설계한 Arm 기반 데이터 센터 CPU Grace는 Hopper 및 Blackwell GPU와 짝을 이뤄 시스템에 들어갔습니다. Arm 생태계를 소유하지 않고도 가속기 중심 작업에 맞춰 메모리, 일관성, 전력, 칩 간 통신을 조정할 수 있었습니다.
Nvidia는 소프트웨어, 스토리지, 클러스터 관리, AI 개발 분야도 인수해 왔습니다. 가장 전략적으로 중요한 거래는 비싼 컴퓨팅 주변의 마찰이나 유휴 시간을 줄인다는 공통 목적을 지닙니다. 이 기준은 일관된 플랫폼 확장과 목적 없는 다각화를 가릅니다.
Blackwell과 Rubin이 랙을 제품으로 만들다
Blackwell과 Rubin은 서버 안의 가속기를 판매하는 단계에서 데이터 센터 랙 전체를 하나의 컴퓨팅 장치로 설계하는 단계로의 이동을 보여 줍니다. 개별 칩의 메모리, 통신, 전력 한계를 넘어서는 모델 크기와 추론 작업이 이 변화를 이끌었습니다.
Nvidia는 2024년 Blackwell 플랫폼을 발표했습니다. Blackwell GPU는 두 개의 큰 다이를 고대역폭 칩 간 연결로 묶어 하나의 논리 장치처럼 동작하게 합니다. GB200 Grace Blackwell Superchip은 Blackwell GPU 두 개와 Grace CPU를 NVLink-C2C로 연결합니다.
GB200 NVL72는 5세대 NVLink로 연결된 Blackwell GPU 72개와 Grace CPU 36개를 담은 수랭식 랙으로 설계를 확장합니다. BlueField DPU와 외부 InfiniBand 또는 Spectrum-X Ethernet 네트워크는 랙을 스토리지와 다른 시스템에 연결합니다. 이제 제품 경계에는 프로세서뿐 아니라 냉각, 케이블, 스위칭, 펌웨어, 오케스트레이션도 포함됩니다.
GB300 시스템을 포함한 Blackwell Ultra는 메모리를 늘리고 긴 컨텍스트를 유지하거나 많은 모델 상태를 이동하는 추론 및 추론형 작업을 겨냥했습니다. Nvidia의 2026 회계연도 실적은 상업적 영향을 보여 줬습니다. 성장에는 Blackwell 컴퓨팅뿐 아니라 이를 규모 있게 운영하는 데 필요한 NVLink, Ethernet, InfiniBand 제품도 기여했습니다.
Rubin 플랫폼은 2026년 생산에 들어갔고, 파트너 시스템은 하반기 배포가 예정됐습니다. Vera CPU, Rubin GPU, NVLink 6 스위치, ConnectX-9 네트워크 어댑터, BlueField-4 데이터 프로세서, Spectrum-6 Ethernet 스위치를 결합합니다. Nvidia는 대규모 전문가 혼합 모델, 장문 컨텍스트 추론, 반복적인 추론과 도구 사용을 수행하는 AI 에이전트에 맞춰 이 부품들을 함께 설계했습니다.
이 연간 플랫폼 주기는 구매자의 문제를 바꿉니다. 클라우드 운영자는 더 이상 고립된 GPU의 최고 처리량만 비교하지 않습니다. 전력당 토큰, 애플리케이션 지연 시간, 실효 메모리 용량, 네트워킹 활용률, 소프트웨어 준비도, 냉각 요구 사항, 설치 시간, 랙이 만들 수 있는 매출을 비교해야 합니다.
랙 단위 통합은 장점과 의무를 함께 만듭니다. Nvidia는 전체 통신 경로를 조정하고 설치당 더 많은 구성품을 판매할 수 있습니다. 고객은 통합 선택지가 적은 검증 설계를 받습니다. 반면 더 큰 공급망을 조정하고 시스템 수준 장애를 관리하며 수랭식을 지원하고, 구매자가 새 아키텍처를 빨리 활용할 만큼 성숙한 소프트웨어를 제공해야 합니다.
이는 총마진에도 영향을 줍니다. 설치당 전체 이익이 높더라도 완성 시스템에는 독립 가속기보다 마진이 낮은 물리 부품이 더 많이 들어갑니다. 제조 결함, 막판 설계 변경, 메모리와 패키징 생산능력 부족은 훨씬 큰 자재 명세서에 영향을 줍니다.
전력은 확고한 한계가 됐습니다. 데이터 센터는 칩을 확보하는 것보다 전력망 용량, 변전소, 발전기, 냉각 장비, 건설 허가를 확보하는 데 더 오래 걸릴 수 있습니다. Nvidia의 미래 성과는 사양서에 적힌 산술 연산 수만이 아니라 와트당, 랙당 유용한 작업에 달렸습니다.
경쟁은 플랫폼의 모든 계층을 시험한다
Nvidia는 범용 가속기, 클라우드가 설계한 칩, 대체 소프트웨어 스택, 협상력을 원하는 고객과 경쟁합니다. 위협은 작업마다 다르므로 하나의 벤치마크로 승부를 가릴 수 없습니다.
AMD는 게이밍 그래픽과 데이터 센터 GPU 모두에서 가장 가까운 직접 경쟁사입니다. Instinct 가속기와 ROCm 소프트웨어는 학습, 추론, 고성능 컴퓨팅을 겨냥합니다. MI300 세대는 의미 있는 배포를 얻었고, 2026년에는 MI350 제품과 Helios 랙 설계를 갖춘 MI400 제품군이 뒤따랐습니다. AMD는 메모리 용량, 개방형 표준, 프로세서 통합, 두 번째 공급업체를 원하는 고객 수요로 경쟁합니다.
Intel은 큰 서버 CPU 기반을 유지하며 독립 GPU와 Gaudi 가속기를 추진했습니다. 가속기 전략이 여러 차례 바뀐 것은 실리콘 주기, 소프트웨어 도입, 시스템 공급을 함께 유지하기가 얼마나 어려운지 보여 줍니다. 신뢰할 만한 대안에는 인상적인 단일 칩이 아니라 프레임워크 지원과 클러스터 규모 운영이 필요합니다.
클라우드 제공업체는 Nvidia의 다른 영역을 공격합니다. Google의 TPU는 내부 서비스에 쓰이고 Google Cloud를 통해 제공되며, Ironwood는 대규모 학습, 추론, 모델 제공을 겨냥합니다. AWS는 Trainium3 시스템을 포함해 모델 개발용 Trainium과 제공용 Inferentia를 제공합니다. 다른 대형 기술 회사도 자체 작업을 위한 가속기나 네트워킹 실리콘을 설계합니다.
맞춤형 칩은 구매자가 모델, 컴파일러, 데이터 센터, 활용률을 통제할 때 유리할 수 있습니다. 필요 없는 기능을 빼고 예측 가능한 소프트웨어에 맞춰 최적화할 수 있기 때문입니다. 반면 다양한 프레임워크 호환성, 많은 모델 유형, 빠른 배포, 여러 클라우드에서의 접근이 필요한 고객에게는 범용 GPU가 강점을 유지합니다.
전문 업체들은 웨이퍼 스케일 프로세서, 데이터플로 아키텍처, 추론 칩, 광 인터커넥트 등 여러 방식을 추구합니다. Cerebras, Groq, 수많은 스타트업은 특정 성능 또는 지연 시간 문제에 집중합니다. 이들이 풀어야 할 과제는 기술적 우위를 공급 가능한 시스템, 신뢰할 만한 소프트웨어, 대형 고객을 위한 충분한 생산능력으로 바꾸는 일입니다.
추상화도 경쟁이 됩니다. PyTorch, JAX, 이식 가능한 컴파일러, 컨테이너형 서비스, 추론 엔진은 애플리케이션 개발자에게 보이는 공급업체별 작업을 줄일 수 있습니다. 팀이 적은 변경으로 모델을 옮길 수 있다면, 각 장치에 맞춰 커널이 깊게 최적화돼 있어도 구매 부서는 협상력을 얻습니다.
구매자는 최고 연산량보다 자체 작업으로 시스템을 비교해야 합니다. 유용한 평가는 선택한 정밀도에서의 모델 정확도, 배치 크기, prefill과 decode 동작, 메모리 한계, 인터커넥트 확장성, 전력, 공급 가능성, 지원, 엔지니어링 노력을 포함합니다. 저렴한 가속기도 유휴 상태가 되거나 포팅에 수개월이 들면 비싸질 수 있습니다. 더 단순한 장치가 지연 시간과 처리량 목표를 충족한다면 고가 플랫폼도 경제성이 없을 수 있습니다.
Nvidia의 위치는 로컬 개발, 클라우드 학습, 대형 클러스터, 프로덕션 추론에 걸쳐 폭넓게 지원되는 하나의 환경을 고객이 중시할 때 가장 강합니다. 구매자가 좁은 대안을 최적화할 만큼의 규모와 소프트웨어 통제력을 가질수록 취약성은 커집니다.
수출 통제와 공급 집중이 운영 위험이 되다
정부 정책과 집중된 제조 기반은 이제 Nvidia의 제품 설계, 재고, 고객 접근, 마진에 영향을 줍니다. 고급 가속기는 상업 AI, 과학 연구, 정보 분석, 군사 응용을 지원할 수 있어 전략 기술로 취급됩니다.
2022년 도입된 미국 수출 제한은 중국과 기타 제한 지역에 판매되는 A100과 H100에 영향을 줬습니다. 2023년 규정은 더 많은 제품과 성능 기준으로 확대됐습니다. Nvidia는 H20을 비롯한 규정 준수 제품을 개발했지만 정책은 계속 바뀌었습니다.
2025년 4월 미국은 H20의 중국 및 일부 관련 시장 수출에 허가를 요구했습니다. Nvidia는 2026 회계연도에 초과 재고와 구매 의무에 대해 45억 달러의 비용을 인식했습니다. 이후 제한된 허가로 일부 H20 출하가 가능해졌고, 2026년 정책은 특정 조건에서 H200 신청을 건별로 검토하도록 허용했습니다. 그러나 Nvidia는 2026 회계연도 말 기준 중국 데이터 센터 컴퓨팅 시장에서 사실상 경쟁할 수 없다고 보고했습니다.
이 사건은 반도체 특유의 위험을 보여 줍니다. 기업은 최종 배송 수개월 전부터 웨이퍼, 메모리, 패키징, 시스템에 약정합니다. 약정 뒤에 나온 규정 하나가 특정 지역용 제품을 쉽게 다른 곳으로 돌릴 수 없는 재고로 만들 수 있습니다. 규정 준수 재설계도 현지 경쟁사가 덜 제한받거나 생산 확대 전 또 다른 규정이 나오면 상업성이 약할 수 있습니다.
반독점 문제는 Nvidia의 시장 지위와 풀스택 전략에서 나옵니다. 규제 당국은 인수, 공급 관행, 묶음 판매, 클라우드 관계, 소프트웨어나 하드웨어 접근을 살필 수 있습니다. 무산된 Arm 거래는 중립 인프라의 통제가 일반적인 제품 확장과 다른 수준의 심사를 받는다는 점을 보여 줬습니다.
제조 집중은 별도의 노출입니다. Nvidia는 팹리스이며 첨단 웨이퍼를 TSMC에 크게 의존합니다. 고대역폭 메모리, 첨단 패키징, 기판, 네트워킹 부품, 전력 시스템, 복잡한 랙을 조립할 수 있는 위탁 제조사도 필요합니다. 한 부품의 생산능력은 다른 부품 부족을 보완하지 못합니다.
대만은 첨단 반도체 제조와 시스템 조립의 중심이고, 한국은 메모리 공급에서 중요합니다. 지진, 전력 중단, 해운 문제, 무역 제한, 분쟁은 생산을 방해할 수 있습니다. 첨단 설비, 검증된 공정, 공급업체 네트워크는 일반 공장으로 주문을 옮긴다고 복제되지 않으므로 지역 다변화에는 수년이 걸립니다.
AI 데이터 센터에는 지역 제약도 있습니다. 대규모 배포에는 발전, 송전, 냉각수 또는 대체 방열 시스템, 토지, 허가, 숙련 운영자가 필요합니다. 에너지, 데이터 위치, 개인정보, 외국인 투자에 관한 국가와 지역 규정은 가속기 공급이 있어도 시스템 설치 장소를 결정할 수 있습니다.
Nvidia는 기술, 정책, 물리 인프라를 함께 관리해야 합니다. 규모는 구매력과 공급업체 조정력을 높이지만, 제품 세대마다 집중된 가치는 실수와 외부 충격의 비용도 키웁니다.
Jensen Huang의 리더십이 Nvidia의 운영 모델을 만들다
Jensen Huang의 긴 재임 기간은 그래픽, 모바일 컴퓨팅, 과학 가속, AI를 거치는 동안 Nvidia에 드문 연속성을 제공했습니다. 그는 창업 때부터 CEO를 맡아 공개 시장이 기술 투자를 낮게 평가하던 시기에도 투자를 이어갈 수 있었습니다.
Huang은 제품 소통과 세부 기술 참여를 결합합니다. 공개 발표에서는 아키텍처를 작업과 시스템 경제성의 언어로 풀고, 내부 검토에서는 직설적인 피드백과 폭넓은 정보 공유로 알려져 있습니다. 가죽 재킷은 알아보기 쉬운 브랜드가 됐지만, 더 중요한 특징은 하드웨어, 소프트웨어, 네트워킹, 시장이 서로에게 미치는 영향을 이해하려는 태도입니다.
Nvidia는 규모에 비해 비교적 수평적인 구조로 운영됩니다. 정보는 긴 비공개 관리 회의 사슬보다 짧은 현황 메시지와 큰 검토 그룹을 통해 고위 리더십에 전달될 수 있습니다. 문제를 빨리 드러내고 전문 인력이 조직 경계를 넘어 가정에 이의를 제기하게 합니다.
이 모델은 압박도 만듭니다. 직접적인 비판, 높은 기대, 빈번한 제품 주기, 미완성 작업의 가시성은 직원에게 부담이 됩니다. 소규모 엔지니어링 회사가 빨리 움직이는 데 도움이 된 방식은 인원, 규제 책임, 고객 약속이 늘면서 더 큰 규율을 요구합니다.
Nvidia의 주요 결정에는 몇 가지 문화 원칙이 반복됩니다.
- 아키텍처나 시장 가정이 틀렸을 때 지적 정직성이 중요합니다.
- 제품 계획은 긴 반도체 주기와 빠른 소프트웨어 반복을 결합합니다.
- 개발자는 채택을 얻어야 하는 핵심 사용자로 대우받습니다.
- 근거가 탄탄하면 기술적 베팅은 수년간 이어질 수 있습니다.
- 한 부품만 따로 최적화하는 것보다 시스템 성능을 우선합니다.
CUDA는 인내심 있는 투자의 가장 분명한 사례이고, NV1 전환은 증거가 가정을 무너뜨릴 때 경로를 버리는 반대 능력을 보여 줍니다. 리더가 어려운 계획과 잘못된 전제를 구분할 때 끈기와 유연성은 함께할 수 있습니다.
창업자 중심 지배구조는 일관성을 뒷받침할 수 있지만 판단도 집중합니다. Nvidia의 미래는 승계 계획, Huang에게 이의를 제기할 수 있는 리더, 모든 중요한 결정에 그의 참여 없이도 작동하는 절차에 달렸습니다. 규모는 스타트업식 긴급함만으로 해결할 수 없는 준법, 안전, 보안, 노동 관리, 정부와 글로벌 기업에 대한 안정적 공급 책임을 더합니다.
회사의 문화는 그래픽 엔지니어링을 넘어 넓어졌습니다. 연구자, 컴파일러 팀, 네트워킹 전문가, 시스템 설계자, 클라우드 운영자, 자동차 조직, 산업 소프트웨어 팀은 하나의 플랫폼을 함께 조정해야 합니다. Nvidia의 조직 과제는 PC 게임을 넘어선 고객에게 장애가 영향을 미칠 수 있는 인프라를 운영하면서도 빠른 기술 토론을 유지하는 일입니다.
제품 변화에 따른 재무적 변화
데이터 센터 시스템이 지배적인 매출원이 되면서 Nvidia의 재무 실적도 바뀌었습니다. 주기적 그래픽 공급업체였던 회사는 세계 최대 컴퓨팅 인프라 기업 중 하나가 됐습니다. 변화는 수년간 점진적이었고 생성형 AI 수요로 급격히 빨라졌습니다.
1999년 IPO 후 매출은 PC 그래픽, 게임 주기, 워크스테이션 수요, 보드 제조사와 OEM 관계에 크게 의존했습니다. 게이밍은 수익성이 있었지만 재고 조정은 급격할 수 있었습니다. 새 그래픽 세대는 수요가 확실해지기 전에 큰 연구비가 필요했습니다.
여러 침체가 이 순환성을 드러냈습니다. 2008년 금융위기는 기술 지출을 줄였습니다. 암호화폐 채굴은 그래픽 카드 수요를 비정상적으로 끌어올렸고, 2018년 재고 조정에 기여했습니다. 팬데믹 시기의 수요와 공급 교란 뒤에는 2022년 또 다른 게임 조정이 있었습니다. Nvidia는 엔지니어링 또는 시장 가정이 빗나갈 때 제품 관련 비용도 인식했습니다.
데이터 센터 매출은 규모와 고객 집중을 모두 바꿨습니다. 2024 회계연도 매출은 609억 달러였고 이 중 데이터 센터가 475억 달러였습니다. 2025 회계연도 매출은 1,305억 달러로 늘었으며 데이터 센터는 1,152억 달러를 기여했습니다. 2026 회계연도 매출은 2,159억 달러였고 데이터 센터가 1,937억 달러였습니다.
2026 회계연도 수치는 구성이 얼마나 바뀌었는지 보여 줍니다. 데이터 센터는 연간 매출의 거의 90%였고, 게임은 여전히 크지만 훨씬 작은 사업이 됐습니다. 2026년 4월 26일 종료 분기 총매출은 816억 달러, 데이터 센터 매출은 752억 달러였습니다. Blackwell 300 시스템과 네트워킹 제품이 본격 확대된 결과입니다.
수익성에는 희소하고 고가인 가속기와 완성 시스템 공급 비용이 함께 반영됩니다. Nvidia는 2026 회계연도 GAAP 총마진 71.1%를 보고했으며, 2025 회계연도 75.0%에서 내려왔습니다. Hopper HGX 제품에서 완성형 Blackwell 데이터 센터 솔루션으로 옮겨간 점과 H20 재고 비용이 영향을 줬습니다. 높은 매출이 제품 구성과 정책 위험을 무의미하게 만들지는 않습니다.
고객 기반에는 또 다른 긴장이 있습니다. 클라우드 제공업체, AI 연구소, 서버 제조사, 기타 대형 직접 고객은 큰 구매 비중을 차지할 수 있습니다. 이들의 자본 지출 계획은 빠르게 바뀔 수 있고, Nvidia 시스템을 사면서도 자체 칩을 개발하는 곳도 있습니다. 전체 수요는 강해도 특정 제품이나 고객이 변동성을 만들 수 있습니다.
Nvidia 주가는 바뀐 기대를 반영했습니다. 투자자들이 AI 인프라 수요 규모를 반영하면서 회사 시가총액은 2023년 1조 달러를 넘었고, 2024년에는 추가 조 달러 단위 이정표를 넘었습니다. 2024년 6월 10대 1 주식 분할이 효력을 냈으며, 2021년 4대 1 분할과 그 이전의 여러 분할이 있었습니다. 분할은 주식 수와 주당 가격을 바꿀 뿐 사업 가치를 바꾸지 않습니다.
건전한 재무 분석은 수요와 지속 가능한 경제성을 분리합니다. 구매자는 AI 용량을 계속 구축하면서도 더 저렴한 추론 칩으로 옮길 수 있습니다. Nvidia는 시스템에 제3자 구성품이 더 많이 들어가며 총마진이 내려가도 매출은 늘 수 있습니다. 빠른 아키텍처 전환은 재고 비용을 만들 수 있습니다. 고객이 더 많은 컴퓨팅을 원해도 전력과 건설 한계가 배포를 늦출 수 있습니다.
장기적 강세 논지는 가속 컴퓨팅이 더 많은 범용 작업을 대체하고, AI 추론이 반복적인 운영 작업이 되며, Nvidia가 시스템과 소프트웨어 가치의 큰 몫을 유지한다는 데 있습니다. 반대 논지는 고객 집중, 맞춤형 실리콘, 대체 가속기, 수출 통제, 공급 제약, 수익성 있는 AI 응용보다 앞서갈 수 있는 지출에 있습니다. 두 관점은 단순히 칩 회사냐 소프트웨어 플랫폼이냐가 아니라 현금 흐름과 배포 경제성으로 평가해야 합니다.
Nvidia의 과거가 말해 주는 다음 단계
Nvidia의 다음 단계는 프로세서 하나를 더 빠르게 만드는 것보다 더 큰 AI 시스템을 경제적으로 운영하는 데 달렸습니다. 학습은 여전히 어렵지만, 프로덕션 추론, 추론형 모델, 소프트웨어 에이전트는 컴퓨팅을 계속 소비할 수 있습니다. 고객의 중요한 지표는 지연 시간, 와트당 토큰, 달러당 토큰, 가동 시간, 설치 전력당 매출로 이동하고 있습니다.
Rubin은 Nvidia가 이 수요에 답하는 방식을 보여 줍니다. 연간 플랫폼 출시, 프로세서와 네트워킹의 더 긴밀한 통합, 더 큰 메모리 시스템, 변화하는 모델 구조에 맞춘 소프트웨어입니다. 더 빠른 주기는 고객을 플랫폼에 머물게 할 수 있지만, 비싼 장비의 경제 수명을 줄이고 공급업체와 엔지니어링 팀의 부담을 키울 수도 있습니다.
피지컬 AI도 큰 베팅입니다. DRIVE, Isaac, Jetson, Omniverse, 시뮬레이션 도구는 모델 학습을 물리 세계를 인지하고 행동하는 기계와 연결합니다. 로봇과 차량에는 낮은 지연 시간의 로컬 추론이 필요하고, 클라우드 시스템은 학습, 플릿 분석, 시뮬레이션을 수행할 수 있습니다. 성과는 가속기 성능만큼 안전, 신뢰성, 센서 데이터, 실제 배포 경제성에 달렸습니다.
디지털 트윈은 같은 접근을 공장, 창고, 전력 시스템, 기타 설계된 환경으로 넓힙니다. 시뮬레이션은 물리적 변경 전에 배치나 로봇 행동을 시험하는 비용을 줄일 수 있습니다. 가치는 정확한 모델과 유지되는 운영 데이터에 달려 있으므로 소프트웨어 통합은 렌더링만큼 어렵습니다.
애플리케이션 제작자에게 이 역사는 AI 인프라가 일상 작업을 바꾸면서도 멀게 느껴지는 이유를 설명합니다. 기술 배경이 없는 창업자도 Koder.ai에서 웹, 서버, 모바일 애플리케이션을 설명할 수 있고, 언어 모델과 여러 에이전트가 채팅 인터페이스 뒤에서 작업을 수행합니다. 이 경험은 그 아래의 가속기, 네트워킹, 호스팅, 모델 소프트웨어를 추상화합니다. 사용자가 GPU 커널이나 클러스터를 관리하지 않아도 더 많은 제품이 AI를 소비할수록 Nvidia의 상업 기회는 커집니다.
제작자는 Nvidia의 기록에서 몇 가지 실용적 교훈을 얻을 수 있습니다. 더 넓은 플랫폼에 자금을 댈 수 있는 시급한 응용을 고르세요. 경쟁사가 우선순위로 보기 전에 개발자 경험에 투자하세요. 사용자가 코드와 학습을 제품에 맡길 때 호환성을 지키세요. 측정된 병목을 없앨 때만 인접 구성 요소로 확장하세요. 표준이나 증거가 틀렸음을 보이면 기술 전제를 버리세요.
정책 입안자는 다른 선택에 맞닥뜨립니다. 가속기 공급, 첨단 패키징, 메모리, 에너지, 클라우드 접근, 소프트웨어 역량은 이제 국가의 컴퓨팅 능력에 영향을 줍니다. 수출 통제는 적대국을 제한할 수 있지만 재고 손실을 만들고 해외 개발자에 대한 공급업체 접근을 줄이며, 제한 시장에서 국내 대안을 장려할 수도 있습니다. 경쟁 정책은 시스템 성능을 개선하는 통합과 고객의 실행 가능한 대안 선택을 막는 관행을 구분해야 합니다.
Nvidia의 역사는 결국 누적된 약속의 연속입니다. 그래픽은 병렬 하드웨어에 자금을 댔습니다. 프로그래머블 셰이더는 범용 컴퓨팅 기회를 드러냈습니다. CUDA는 소프트웨어와 개발자를 쌓았습니다. AlexNet은 결정적인 AI 작업을 제시했습니다. DGX, Mellanox, Grace, Blackwell, Rubin은 랙이 컴퓨터가 될 때까지 제품 경계를 넓혔습니다.
이 흐름은 Nvidia의 선두를 만들었지만 영구성을 보장하지는 않습니다. 회사는 경쟁사가 가격, 개방성, 공급 다변화, 특화 성능을 공격하는 동안 다음 운영 제약을 계속 해결해야 합니다. 과거의 성공은 컴퓨팅 모델이 바뀐 순간을 알아본 데서 나왔습니다. 미래는 현재 모델이 의심하지 않는 가정이 되기 전에 다시 그 변화를 알아볼 수 있는지에 달렸습니다.
자주 묻는 질문
1990년대 다른 칩 회사들과 비교해 Nvidia의 초기 비전은 무엇이 달랐나요?
Nvidia는 3D 그래픽이 비싼 워크스테이션에서 대중적인 PC로 옮겨가며, 전용 그래픽 프로세서와 소프트웨어가 함께 필요해질 것이라는 구체적인 판단에서 출발했습니다.
Nvidia는 범용 반도체 회사가 되려 하기보다 다음에 집중했습니다.
- 전문가만이 아닌 모두를 위한 가속 그래픽
- 칩과 소프트웨어 드라이버/API를 함께 설계하는 방식
- 대형 PC 제조사가 기본 사양으로 채택할 수 있는 가격과 OEM 도입성
실시간 그래픽이라는 하나의 문제를 깊이 파고든 경험이 훗날 GPU 컴퓨팅과 AI 가속으로 이어질 기술적, 문화적 기반이 됐습니다.
CUDA는 어떻게 Nvidia가 AI와 딥러닝의 기본 하드웨어가 되도록 도왔나요?
CUDA는 Nvidia GPU를 고정 기능 그래픽 하드웨어에서 범용 병렬 컴퓨팅 플랫폼으로 바꿨습니다.
AI 분야에서 우위를 만드는 데 기여한 요소는 다음과 같습니다.
- 프로그래밍 단순화: 연구자들은 그래픽 API를 억지로 활용하지 않고 C/C++를 쓸 수 있었고, 이후 프레임워크를 통해 Python도 사용했습니다.
- 재사용 가능한 라이브러리: cuBLAS, cuFFT, cuDNN 등이 수학과 신경망 작업을 바로 가속했습니다.
- 생태계의 탄력: TensorFlow와 PyTorch 같은 프레임워크가 CUDA를 중심으로 최적화되며 Nvidia가 기본 선택지가 됐습니다.
- 누적되는 전환 비용: CUDA 기반 프로젝트가 늘수록 다른 가속기로 옮기는 비용도 커졌습니다.
딥러닝이 본격적으로 성장했을 때 CUDA의 도구, 문서, 사용 방식은 이미 충분히 성숙해 있었고, Nvidia는 큰 선점 효과를 얻었습니다.
Mellanox 인수는 Nvidia의 AI 전략에서 왜 그렇게 중요했나요?
Mellanox 인수로 Nvidia는 AI 슈퍼컴퓨터에서 수천 개 GPU를 연결하는 네트워크 패브릭을 확보했습니다.
대형 모델에서는 칩의 속도만큼 데이터와 그래디언트를 얼마나 빠르게 주고받는지가 중요합니다. Mellanox는 다음을 제공했습니다.
- 저지연, 고대역폭 연결을 위한 InfiniBand와 고급 Ethernet
- RDMA와 고성능 인터커넥트 전문성
- NVLink/NVSwitch 기반 시스템을 위한 구성 요소
그 결과 Nvidia는 독립형 가속기 카드만 파는 대신 GPU, 네트워킹, 소프트웨어를 함께 최적화한 DGX, HGX, 전체 데이터 센터 설계를 제공할 수 있게 됐습니다.
Nvidia는 오늘날 어떻게 돈을 벌며, 매출 구성은 어떻게 달라졌나요?
Nvidia의 매출은 게임 중심에서 데이터 센터 중심으로 크게 바뀌었습니다.
큰 틀에서는 다음과 같습니다.
- 게이밍: GeForce GPU, 게이밍 노트북, 관련 소프트웨어는 여전히 크고 수익성 높은 사업입니다.
- 데이터 센터: AI 학습과 추론, 클라우드 GPU 인스턴스, 네트워킹을 포함한 DGX/HGX 시스템이 주도하는 핵심 성장 동력입니다.
- 전문 시각화: 디자이너와 엔지니어를 위한 워크스테이션 GPU입니다.
- 자동차와 엣지: 현재 규모는 작지만 DRIVE, Jetson, 로보틱스, Omniverse 기반 솔루션 같은 전략 분야입니다.
고급 AI 플랫폼과 네트워킹은 높은 가격과 마진을 형성하며 데이터 센터 성장이 Nvidia의 수익성을 바꿨습니다.
AMD, Intel, 맞춤형 AI 칩은 Nvidia에 어떤 경쟁 위협이 되나요?
Nvidia는 기존 경쟁사와 맞춤형 가속기 양쪽에서 압박을 받고 있습니다.
- AMD: 게이밍 GPU와 MI 시리즈 AI 가속기에서 직접 경쟁하며, 종종 FLOP당 낮은 비용을 내세웁니다.
- Intel: CPU, 자체 GPU, 전용 AI 칩으로 경쟁합니다.
- 클라우드와 빅테크: Google의 TPU, Amazon의 Trainium/Inferentia 등은 Nvidia 의존도를 낮추기 위해 자체 칩을 만듭니다.
- 스타트업과 지역 업체: 특화 AI 가속기와 중국 공급업체는 비용, 효율, 규제 틈새시장을 노립니다.
Nvidia의 주요 방어력은 성능 선도, CUDA와 소프트웨어 생태계, 통합 시스템입니다. 다만 대안이 충분히 좋고 프로그래밍하기 쉬워지면 점유율과 가격 결정력은 압박을 받을 수 있습니다.
수출 통제, 규제, 지정학은 Nvidia 사업에 어떤 영향을 미치나요?
고성능 GPU는 이제 특히 AI 분야에서 전략 기술로 취급됩니다.
Nvidia에 미치는 영향은 다음과 같습니다.
- 수출 통제: 미국 규정은 중국과 일부 지역으로의 최고급 AI GPU 수출을 제한합니다. Nvidia는 사양을 낮춘 제품을 설계해야 하며, 고마진 수요 일부를 잃을 수 있습니다.
- 반독점 심사: 규제 당국은 무산된 Arm 인수처럼 Nvidia의 지배력을 강화할 수 있는 거래와 사업 관행을 면밀히 살핍니다.
- 공급망 위험: TSMC와 대만의 첨단 패키징에 크게 의존하기 때문에 지정학적 위험과 생산능력 부족에 노출됩니다.
따라서 Nvidia의 전략은 기술과 시장뿐 아니라 정책, 무역 규정, 지역 산업 계획까지 고려해야 합니다.
Nvidia의 AI 소프트웨어 스택은 쉽게 말해 어떤 구조인가요?
Nvidia의 AI 스택은 대부분의 개발자가 GPU의 복잡성을 직접 다루지 않도록 해 주는 여러 계층의 도구 모음입니다.
- CUDA: GPU를 병렬 프로세서로 활용하게 하는 핵심 프로그래밍 모델
- 수학 및 HPC 라이브러리: 빠른 선형대수와 수치 연산을 위한 cuBLAS, cuSPARSE, cuFFT 등
- AI 전용 라이브러리: 신경망 연산용 cuDNN, 추론 최적화용 TensorRT, 모델 서빙용 Triton
- 데이터와 분석: GPU 가속 데이터 과학과 분석을 위한 RAPIDS
- 산업별 SDK: 자동차 DRIVE, 헬스케어 Clara, 로보틱스 Isaac, 시뮬레이션과 디지털 트윈 Omniverse
대부분의 팀은 PyTorch나 TensorFlow 같은 프레임워크를 통해 이 라이브러리를 사용하므로 저수준 GPU 코드를 직접 작성할 일은 드뭅니다.
자율주행과 로보틱스에 대한 Nvidia의 투자는 전체 전략과 어떻게 맞물리나요?
자율주행과 로보틱스는 Nvidia의 핵심 AI 및 시뮬레이션 플랫폼을 물리적 시스템으로 확장한 분야입니다.
전략적으로 이들은 다음과 같은 역할을 합니다.
- 데이터 센터용으로 만든 동일한 CUDA와 AI 라이브러리를 재사용합니다.
- 엣지 및 임베디드 GPU인 Jetson과 차량용 Drive 플랫폼 수요를 만듭니다.
- 하드웨어, 소프트웨어, 도구를 결합해 자동차 회사와 산업 기업 같은 장기 고객을 확보합니다.
- Omniverse와 Isaac을 통한 대규모 시뮬레이션 수요를 만들어 GPU 배치를 뒷받침합니다.
이 시장은 현재 클라우드 AI보다 작을 수 있지만, 지속적인 고마진 매출과 산업 전반의 생태계 확대를 가져올 수 있습니다.
그래픽 스타트업에서 AI 플랫폼으로 진화한 Nvidia에게서 창업자와 엔지니어는 무엇을 배울 수 있나요?
Nvidia의 성장 과정에서는 몇 가지 실용적인 교훈을 얻을 수 있습니다.
- 전체 스택을 장악하라: 칩, 시스템 설계, CUDA와 SDK 같은 소프트웨어를 결합하면 강한 진입장벽이 생깁니다.
- 새로운 컴퓨팅 병목에 일찍 투자하라: 프로그래머블 셰이더, CUDA, 딥러닝 지원은 시장이 분명해지기 전에 시작됐습니다.
- 개발자를 핵심 고객으로 대하라: 문서, 라이브러리, 컨퍼런스, 직접 지원은 시간이 갈수록 도입을 키웁니다.
- 생태계와 표준에 맞춰라: NV1의 실패는 지배적인 API인 DirectX에 맞추는 일이 맞서 싸우는 것보다 중요하다는 점을 보여 줬습니다.
창업자와 개발자에게 핵심은 원시 성능만 보지 말고, 깊은 기술적 통찰을 생태계 관점과 결합하라는 것입니다.
AI 하드웨어 아키텍처가 전통적인 GPU를 넘어선다면 Nvidia의 위치는 어떻게 달라질 수 있나요?
미래의 작업이 GPU에 잘 맞는 방식에서 벗어난다면 Nvidia는 하드웨어와 소프트웨어를 빠르게 바꿔야 합니다.
가능한 변화는 다음과 같습니다.
- 특정 작업에서 유연성 대신 효율을 택하는 전용 AI ASIC의 확산
- 현재 GPU 설계에 잘 맞지 않는 뉴로모픽, 아날로그, 근본적으로 다른 메모리 계층 같은 새 패러다임
- CUDA의 전환 비용을 낮추는 표준화된 오픈 소프트웨어 스택과 더 나은 CPU/ASIC 도구
Nvidia는 새 작업에 맞게 아키텍처를 발전시키고, 새 하드웨어 유형을 지원하거나 감추는 소프트웨어를 확장하며, 네트워킹과 플랫폼, 산업별 SDK 같은 시스템 역량으로 입지를 유지하려 할 가능성이 큽니다.
Nvidia의 역사는 전환 능력을 보여 주지만, 이런 변화는 회사가 실제로 얼마나 유연한지 시험할 것입니다.