NEXT UNION
AI

4대 B200서 동시 사용자 최대 2.5배…Nemotron 3 Ultra NIM 최적화

사용자당 50 TPS 유지 조건을 함께 제시

AI 모델 서비스에서는 이용자가 늘어날 때 사용자별 처리 속도를 얼마나 유지할 수 있는지가 핵심 과제다. Nemotron 3 Ultra NIM은 4대의 B200 GPU에서 동시 사용자 수와 사용자당 처리량을 함께 측정한 결과를 제시했다.

2026-09-15 09:31 이재은 기자
자료사진: NVIDIA AI X

AI 모델 서비스에서는 이용자가 늘어날 때 사용자별 처리 속도를 얼마나 유지할 수 있는지가 핵심 과제다. Nemotron 3 Ultra NIM은 4대의 B200 GPU에서 동시 사용자 수와 사용자당 처리량을 함께 측정한 결과를 제시했다.

확인된 수치는 동시 사용자 수를 최대 2.5배까지 지원하면서도 사용자당 초당 50건의 처리량을 유지했다는 것이다. GPU 수는 4대였고, 사용된 GPU는 B200이었다.

이 결과의 의미는 동시 사용자 확대 수치만 따로 떼어 보는 데 있지 않다. 사용자당 50 TPS를 유지했다는 조건이 함께 제시됐기 때문에, 처리량을 낮춰 이용자 수만 늘린 결과와는 구분해 읽어야 한다.

다만 공개된 수치만으로 비용 절감, 전력 효율, 다른 GPU 구성에서의 성능까지 판단할 수는 없다. 최대 2.5배라는 수치 역시 4대 B200과 사용자당 50 TPS라는 측정 조건 안에서 해석해야 한다.

따라서 이번 결과를 평가할 때의 핵심 쟁점은 동시 사용자 수, 사용자당 처리량, GPU 구성을 하나의 성능 조건으로 함께 비교하는 것이다. 확인되지 않은 운영 효과나 다른 환경으로의 일반화는 이 수치와 분리해 다뤄야 한다.

← 홈으로 돌아가기