본문바로가기

홍보센터

PR

위존 AI Infrastructure Insight (AI 인프라 인사이트) 시리즈 2편입니다.

GPU가 아무리 빨라도, 데이터가 제때 도착하지 않으면 기다릴 수밖에 없습니다.


이번 편에서는 GPU의 데이터 병목이 어디에서 발생하는지

그리고 GPUDirect Storage (GPU 다이렉트 스토리지), RDMA/RoCE와 DPU (Data Processing Unit, 데이터 처리 장치)가 

이 문제를 어떻게 해결하는지 쉽게 풀어봅니다.





GPU는 왜 데이터를 기다릴까?

AI 인프라를 설계하다 보면 자주 마주치는 질문이 있습니다.


“GPU는 충분히 좋은데, 왜 기대한 만큼 성능이 나오지 않을까?”

원인은 GPU 자체가 아니라 스토리지에서 GPU까지 데이터를 전달하는 경로에 있을 수 있습니다.


대규모 AI 학습이나 HPC (High Performance Computing, 고성능 컴퓨팅) 환경에서는 GPU의 연산 성능이 높아지는 만큼 처리해야 할 데이터도 빠르게 증가합니다.

이때 스토리지와 네트워크의 데이터 공급 속도가 GPU의 처리 속도를 따라가지 못하면, GPU가 연산할 데이터를 기다리는 **I/O Bottleneck (입출력 병목)**이 발생할 수 있습니다.

즉, 고성능 GPU를 제대로 활용하려면 GPU 사양뿐 아니라

Storage → Network → GPU

로 이어지는 전체 데이터 경로를 함께 봐야 합니다.





01. GPU는 왜 데이터를 기다릴까?

기존 데이터 전송 구조에서는 스토리지에서 읽어온 데이터가 CPU와 시스템 메모리를 거쳐 GPU로 전달됩니다.


기존 데이터 경로

Storage → CPU/System Memory → GPU

데이터 규모와 처리량이 증가할수록 CPU가 처리해야 하는 데이터 복사와 I/O 작업도 함께 증가합니다.

CPU가 데이터 이동에 많은 자원을 사용하고 GPU에 필요한 데이터 공급이 늦어지면, GPU 자체의 연산 성능이 충분하더라도 전체 시스템의 처리 성능은 떨어질 수 있습니다.

쉽게 말하면,

GPU가 느린 것이 아니라GPU까지 데이터가 도착하는 과정이 느린 것입니다.

고성능 GPU에 투자한 만큼 실제 성능을 활용하려면 GPU 자체뿐 아니라 데이터를 공급하는 구조까지 최적화해야 하는 이유입니다.





02. GPUDirect Storage는 무엇을 바꿀까?

이러한 데이터 경로를 개선하기 위한 기술이 **GPUDirect Storage, GDS (GPU 다이렉트 스토리지)**입니다.

기존 구조에서는 스토리지의 데이터가 CPU 시스템 메모리를 거쳐 GPU로 이동하면서 추가적인 데이터 복사가 발생합니다.

GPUDirect Storage는 이러한 불필요한 데이터 복사를 줄여 스토리지와 GPU 메모리 사이에 보다 직접적인 데이터 경로를 구성합니다.

기존 방식

Storage → CPU/System Memory → GPU

GPUDirect Storage 적용

Storage → GPU Memory

경로가 단순해지면 CPU의 I/O 처리 부담을 줄이고 GPU에 데이터를 보다 효율적으로 공급할 수 있습니다.

그런데 AI 인프라의 규모가 커지면 또 하나의 문제가 생깁니다.



스토리지가 네트워크 너머에 있다면?

대규모 AI·HPC 환경에서는 여러 GPU 서버가 별도의 고성능 스토리지를 공유하는 구조가 많이 사용됩니다.

이 경우 데이터가 이동하는 경로에 **Network (네트워크)**가 추가됩니다.

Remote Storage → Network → GPU

따라서 스토리지의 속도만 빠르게 만드는 것으로는 충분하지 않습니다.

네트워크를 통해서도 대용량 데이터를 빠르고 효율적으로 전달할 수 있어야 합니다.

이때 중요한 기술이 RDMA, RoCE, NVMe-oF입니다.





03. RDMA·RoCE·NVMe-oF는 어떤 역할을 할까?

용어는 어렵지만 각각의 역할을 데이터가 이동하는 과정으로 보면 이해하기 쉽습니다.

RDMA — CPU 부담을 줄이는 고속 데이터 전송

**RDMA (Remote Direct Memory Access, 원격 직접 메모리 접근)**는 CPU의 개입을 최소화하면서 원격 시스템의 메모리에 데이터를 직접 전달할 수 있도록 하는 기술입니다.

데이터를 전송할 때 CPU가 지속적으로 관여하는 부담을 줄여 서버 간 고속 데이터 전송에 활용됩니다.

RoCE — RDMA를 Ethernet 환경에서

**RoCE (RDMA over Converged Ethernet, 이더넷 기반 RDMA)**는 RDMA 통신을 Ethernet (이더넷) 네트워크에서 구현할 수 있도록 하는 방식입니다.

즉, Ethernet 기반의 네트워크에서도 RDMA를 활용한 고속·저지연 데이터 전송 환경을 구성할 수 있습니다.

NVMe-oF — 원격 스토리지까지 빠르게

**NVMe-oF (NVMe over Fabrics, 패브릭 기반 NVMe)**는 네트워크를 통해 원격 NVMe 스토리지에 고속으로 접근할 수 있도록 하는 프로토콜입니다.

쉽게 말하면 네트워크 너머에 있는 고속 스토리지를 효율적으로 사용할 수 있도록 연결하는 기술입니다.

이러한 기술을 활용하면 GPU 서버와 원격 스토리지 사이에서도 보다 효율적인 고속 데이터 경로를 구성할 수 있습니다.

하지만 데이터 전송량이 증가할수록 CPU가 처리해야 하는 네트워크·스토리지 작업도 증가합니다.

바로 이 지점에서 DPU가 필요해집니다.





04. 그렇다면 DPU는 왜 필요할까?

GPU에 데이터를 더 빠르게 공급하려면 네트워크와 스토리지도 더 많은 데이터를 처리해야 합니다.

문제는 이 과정까지 CPU가 담당하면 정작 CPU가 애플리케이션 연산보다 데이터 이동과 I/O 처리에 많은 자원을 사용하게 된다는 것입니다.

DPU는 이 부담을 CPU에서 덜어냅니다.

DPU (Data Processing Unit, 데이터 처리 장치)는 네트워크·스토리지·보안과 같은 인프라 처리를 CPU에서 분리해 전담하고 가속하는 프로세서입니다.

위존이 제공하는 Mango BoostX™ DPU는 네트워크·스토리지·보안 등의 인프라 워크로드를 CPU에서 오프로드하고, NVMe-oF, TCP/IP, RoCEv2 등의 데이터 처리를 전용 하드웨어에서 가속합니다. 

BoostX Datasheet.pdf

이를 통해 CPU와 GPU는 본연의 연산에 더 집중하고, 데이터는 보다 효율적인 경로로 이동할 수 있습니다.

Mango BoostX™는 최대 400Gb/s Ethernet (이더넷) 연결을 지원하며, NVMe/RoCEv2, NVMe/TCP 등의 고속 스토리지 연결을 지원합니다. 

BoostX Datasheet.pdf

또한 표준 PCIe와 Ethernet을 기반으로 기존 시스템 및 표준 프로토콜과의 연동을 고려한 구조를 제공합니다. 

BoostX Datasheet.pdf

결국 DPU의 역할을 한 문장으로 정리하면,

GPU를 더 빠르게 만드는 것이 아니라,

GPU가 기다리지 않도록 데이터가 가는 길을 빠르게 만드는 것.

이것이 Mango BoostX™ DPU가 AI 인프라에서 담당하는 역할입니다.





05. 기존 구조와 무엇이 달라질까?

GPU 성능을 제대로 활용하려면 개별 장비의 성능보다 데이터가 이동하는 전체 구조를 살펴볼 필요가 있습니다.


구분

기존 CPU 중심 구조

GDS + DPU 기반 구조

데이터 이동

CPU/System Memory 경유

보다 직접적인 GPU 데이터 경로 구성

CPU 역할

애플리케이션 + I/O 처리

애플리케이션 연산에 보다 집중

네트워크·스토리지 처리

CPU에서 처리

DPU로 오프로드·가속

원격 스토리지 연결

네트워크 I/O 영향 증가

RDMA/RoCE·NVMe-oF 기반 고속 연결

인프라 설계 관점

개별 장비 성능 중심

Storage–Network–GPU 전체 경로 최적화


여기서 중요한 것은 DPU 하나를 추가하는 것 자체가 목적이 아니라는 점입니다.

GPU와 스토리지 사이에서 발생하는 데이터 이동과 네트워크·스토리지 처리를 효율화하여 GPU가 연산에 집중할 수 있는 데이터 공급 구조를 만드는 것이 핵심입니다.





06. 우리 AI 인프라에도 DPU가 필요할까?

DPU의 효과는 현재 운영하고 있는 워크로드와 인프라 구조에 따라 달라질 수 있습니다.

따라서 제품 도입부터 결정하기보다 현재 GPU 인프라에서 실제 병목이 어디에서 발생하고 있는지 확인하는 것이 먼저입니다.

특히 다음과 같은 환경이라면 DPU 기반 데이터 경로 최적화를 검토할 수 있습니다.


대규모 AI 학습·HPC 환경: 처리해야 할 데이터 I/O가 많아 GPU가 지속적으로 대용량 데이터를 요구하는 경우

원격 공유 스토리지 환경: 여러 GPU 서버가 네트워크를 통해 하나의 고성능 스토리지를 공유하는 경우

데이터 로딩 대기 시간이 긴 환경: GPU 연산 과정에서 데이터 로딩이나 I/O 대기 시간이 반복적으로 발생하는 경우

CPU의 I/O 처리 부담이 높은 환경: 네트워크·스토리지 처리로 CPU 자원이 지속적으로 사용되는 경우

Scale-Out (수평 확장)이 필요한 환경: 향후 GPU 서버와 스토리지 노드를 지속적으로 확장해야 하는 경우


따라서 DPU 도입을 검토할 때 가장 먼저 확인해야 할 질문은 간단합니다.

“DPU를 도입해야 할까?”보다“현재 GPU가 기다리고 있는 구간은 어디일까?”


병목의 위치를 정확하게 알아야 적합한 인프라 최적화 방법도 결정할 수 있습니다.





한눈에 보는 핵심 정리

① GPU가 기다리는 이유 GPU 자체가 아니라 스토리지에서 GPU까지 데이터를 공급하는 과정에서 I/O Bottleneck (입출력 병목)이 발생할 수 있습니다.
② GPUDirect Storage의 역할 CPU 시스템 메모리를 경유하는 불필요한 데이터 복사를 줄여 스토리지와 GPU 사이의 데이터 경로를 효율화합니다.
③ RDMA·RoCE·NVMe-oF의 역할 스토리지가 네트워크 너머에 있는 환경에서 고속 데이터 전송과 원격 스토리지 접근을 지원합니다.
④ DPU의 역할 네트워크·스토리지 등의 인프라 처리를 CPU에서 분리하여 오프로드하고 가속합니다.

결국,

Storage → Network → DPU → GPU

전체 데이터 경로가 함께 최적화되어야 고성능 GPU도 제 성능을 발휘할 수 있습니다.





FAQ

Q1. DPU를 도입하면 GPU 인프라에서 무엇이 달라지나요?

DPU는 네트워크·스토리지 등의 데이터 처리를 CPU에서 분리해 전담하고 가속합니다.

이를 통해 CPU와 GPU가 본연의 연산에 더 집중할 수 있고, 스토리지에서 GPU까지 데이터를 공급하는 전체 경로를 보다 효율적으로 구성할 수 있습니다.


Q2. GPUDirect Storage와 DPU를 함께 활용하면 어떤 장점이 있나요?

GPUDirect Storage는 스토리지와 GPU 메모리 사이에서 CPU 시스템 메모리를 경유하는 불필요한 데이터 복사를 줄여 보다 직접적인 데이터 경로를 구성합니다.

여기에 DPU를 활용하면 네트워크·스토리지 I/O 처리를 CPU에서 분리할 수 있어 GPU에 데이터를 공급하는 과정에서 발생하는 CPU 부담과 데이터 병목을 줄이는 데 도움이 됩니다.


Q3. 원격 스토리지 환경에서는 RDMA·RoCE·NVMe-oF가 왜 중요한가요?

여러 GPU 서버가 네트워크 너머의 스토리지를 공유한다면 스토리지 자체의 속도뿐 아니라 네트워크를 통해 데이터를 얼마나 빠르게 전달하느냐도 중요합니다.

RDMA·RoCE는 고속·저지연 데이터 전송을 지원하고, NVMe-oF는 원격 NVMe 스토리지에 고속으로 접근할 수 있도록 해 GPU와 원격 스토리지 사이의 효율적인 데이터 경로 구성을 지원합니다.


Q4. Mango BoostX™ DPU는 AI 인프라에서 어떤 역할을 하나요?

Mango BoostX™는 네트워킹·스토리지·보안 등의 인프라 워크로드를 CPU에서 오프로드하고, NVMe-oF, TCP/IP, RoCEv2 등의 데이터 처리를 전용 하드웨어에서 가속합니다. 

이를 통해 CPU의 인프라 처리 부담을 줄이고 GPU에 데이터를 효율적으로 공급할 수 있는 고성능 데이터 경로 구축을 지원합니다.


Q5. 어떤 AI 인프라에서 DPU 도입을 우선 검토하면 좋을까요?

대규모 AI 학습이나 HPC처럼 데이터 I/O가 많거나, 여러 GPU 서버가 원격 스토리지를 공유하거나, 데이터 로딩과 네트워크·스토리지 처리로 CPU 부담이 커지는 환경이라면 우선 검토할 수 있습니다.

핵심은 단순히 DPU를 추가하는 것이 아니라 현재 인프라의 병목을 확인하고 워크로드에 맞는 데이터 경로를 설계하는 것입니다.





GPU의 성능보다, GPU까지 가는 길을 봐야 합니다.

AI 인프라의 경쟁력은 이제 GPU를 얼마나 많이 확보했는가만으로 결정되지 않습니다.

고성능 GPU에 데이터를 얼마나 빠르고 효율적으로 공급하는지, 그 과정에서 CPU·네트워크·스토리지 자원을 얼마나 효율적으로 활용하는지가 실제 인프라 성능을 좌우합니다.

위존은 GPU·네트워크·스토리지를 개별 장비가 아닌 하나의 데이터 경로 관점에서 진단하고, MangoBoost DPU 기반의 AI 인프라 가속 및 최적화 방안을 제공합니다.


현재 구축한 GPU 인프라에서 데이터를 기다리는 구간은 어디일까요?

위존은 고객의 AI 워크로드와 기존 인프라 환경을 기반으로
Storage–Network–GPU 데이터 경로의 병목을 분석하고 최적화 방안을 함께 검토합니다.

AI Infrastructure Optimization Partner, WeZON


㈜위존 AI 인프라 운영팀
T. 02-555-7033 F. 02-555-7010 E. info@wezon.co.kr


#AIInfrastructure  #DPU  #GPUDirectStorage  #RDMA  #RoCE  #NVMeoF  #GPUInfrastructure  #HPC #DataCenter


SITEMAP