
프로덕션 환경의 RTX 5090: CGW SIGGRAPH 현장 보고서 속 수치들
개요
소개
올해 초 Super Renders Farm은 첫 RTX 5090 노드를 프로덕션에 투입했으며, 이 카드의 실제 가치는 벤치마크 스크립트가 아니라 실제 운영 중인 렌더 큐가 판단하도록 했습니다. 저희는 이 이야기 전체를 Computer Graphics World의 SIGGRAPH 2026 호에 실었습니다: 실제 클라이언트 씬에서 나온 7주간의 작업 기록이며, 실패 사례까지 모두 담았습니다.
이 글은 그 기사의 후속편으로, 동일한 프로덕션 데이터를 사람들이 실제로 인용하고 싶어 하는 수치로 정리했습니다. 각 수치를 그대로 믿기보다 직접 검증할 수 있도록 방법론도 함께 설명합니다. 딱 하나의 숫자만 필요하다면 아래의 중앙값 3.2배 속도 향상이 그것입니다. 책임감 있게 인용하려면 계속 읽어보시기 바랍니다.
Computer Graphics World 소개: 이 데이터 세트는 CGW의 SIGGRAPH 2026 호에 실린 저희 현장 보고서를 뒷받침합니다. CGW 2026년 4·5·6월 디지털판에서 확인하실 수 있습니다. 동일한 배포 환경(노드 하드웨어와 수치 산출 방식 포함)을 소개하는 짧은 영상은 이 영상 워크스루에서 볼 수 있습니다.
수치 산출 방법
여기 실린 모든 수치는 통제된 실험실 테스트가 아니라 Super Renders Farm의 프로덕션 로그에서 나온 것입니다. RTX 5090을 구동하는 노드 구성은 단순합니다: 노드당 카드 2장, RAM 128GiB, 논리 코어 32개, Windows 11, GPU당 작업 1개로 운영되어 아래의 모든 수치는 카드 1장 기준의 순수한 값입니다.
속도 향상 비교를 위해 별도로 씬을 준비하지는 않았습니다. 신형 노드와 이전 세대 노드 양쪽에서 실제 업무 과정 중에 실행된 작업을 그대로 가져왔으며, 동일한 씬과 동일한 사용자를 기준으로 삼고 한 씬이 집계에 포함되려면 양쪽에서 각각 최소 3개의 작업이 필요하도록 했습니다. 수치를 어떻게 읽어야 하는지에 영향을 주는 방법론 참고 사항이 있습니다: 각 씬은 양쪽에서 자신의 프레임별 시간의 중앙값을 기여하며, 3.2배는 이 38개 비율의 중앙값, 즉 중앙값의 중앙값이므로 프레임 하나가 느리다고 해서 결과가 기울지 않습니다. 이 필터를 적용한 결과 2026년 4월과 5월에 걸쳐 1,419건의 개별 렌더 작업에서 뽑아낸 38쌍의 씬이 남았습니다: RTX 5090 노드에서 503건, 가상 머신 내부에서 GPU 패스스루로 실행되는 이전 세대 RTX 3080급 노드에서 916건입니다. 전부 Blender Cycles GPU 작업이며, 다른 렌더 엔진이나 다른 하드웨어 세대로 일반화하지 않습니다.
핵심 수치: 중앙값 3.2배
이 38개 씬 전체에서 RTX 5090 1장의 프레임당 중앙값 시간은 이전 세대 RTX 3080급 노드 대비 약 69% 감소했으며, 이는 중앙값 3.2배의 속도 향상에 해당합니다. 중앙값만큼이나 분포도 중요합니다: 사분위 범위는 2.7배에서 3.4배, 38개 씬 전체의 전체 범위는 1.6배에서 5.1배이며, 중앙값에 대한 부트스트랩 95% 신뢰구간은 3.0배에서 3.3배(재표본추출 20,000회)입니다.
속도 향상은 씬 유형에 따라 고르게 분포되지 않습니다. 씬별 속도 향상을 기존 하드웨어에서의 프레임 소요 시간에 대해 그래프로 그려 보면 느슨한 양의 경향이 나타나며, 스피어만 순위 상관계수는 약 0.34(양측 p값은 약 0.04)로, 방향성은 있지만 예측력은 크지 않은 수준입니다. 각각 수 초에 불과한 짧은 프레임은 향상 폭이 가장 작았는데, 고정된 작업당 오버헤드(씬 로드, 동기화, 이전 가상화 계층)가 짧은 처리 시간에서 더 큰 비중을 차지하기 때문입니다. 무거운 프레임일수록 대체로 향상 폭이 컸지만 실제로는 편차도 컸습니다: 한 무거운 씬은 병목이 GPU가 아니라 스토리지 또는 CPU 바운드 단계였을 가능성이 있어 1.6배에 그쳤습니다.
여기서 다시 한번 강조할 만한 세 가지 정직성 참고 사항이 있습니다. 첫째, 이는 고정된 벤치마크 씬이 아니라 실제 운영 중인 큐에서 뽑은 관찰 데이터이며, 사용자가 재렌더링 사이에 설정을 바꾼 경우도 있습니다. 둘째, 이 비교는 노드 대 노드 비교이며 이전 세대 쪽은 가상화 환경에서, RTX 5090 쪽은 베어메탈에서 실행되므로 격차의 일부는 실리콘 자체가 아니라 아키텍처 차이에서 비롯됩니다. 셋째, 기준선은 현세대 카드가 아니라 이 작업들이 실제로 실행된 RTX 3080급 하드웨어이며, RTX 5090이 다른 현세대 카드와 비교해 어떤지에 대해서는 어떤 주장도 하지 않습니다.
완료율과 드라이버 안정성
51일(7주가 조금 넘는 기간) 동안 이 노드는 작업의 99.6%, 즉 약 4,900건을 완료했습니다. 나머지 18건은 실패했습니다. 스케줄러는 실패 자체만 기록할 뿐 원인은 기록하지 않으므로, 원인을 추측하지 않습니다.
드라이버 버전 581.80(CUDA 13.0 기반) 하나가 4월 1일부터 5월 22일까지 전체 기간 동안 롤백이나 중간 교체 없이 그대로 운영되었습니다. 같은 기간 이전 세대 노드는 드라이버 565.90을 사용했습니다. 이 정도로 신제품인 하드웨어라면, 별다른 사건 없는 지루한 드라이버 로그야말로 저희가 바라는 결과입니다.
이미 기본값이었던 AI 디노이징
RTX 5090 노드에서 Cycles 작업의 약 83%가 AI 디노이징 패스(OptiX 또는 Intel Open Image Denoise)를 표준으로 사용했으며, 이전 세대 노드의 비율도 사실상 동일합니다. Blender 3.0 이후 Cycles가 제공한 모든 렌더 타임 디노이저는 AI 기반이며, 저희 프로덕션 작업은 Blender 3.6부터 5.1까지 걸쳐 있습니다. 하드웨어 세대가 바뀌었다고 디노이징 방식이 달라지지는 않았습니다. AI 디노이징은 RTX 5090이 도입되기 전부터 이미 일상적으로 쓰이고 있었습니다. 신형 카드가 바꾸는 것은 이미 표준화된 이 단계를 둘러싼 패스 트레이싱 처리량입니다. 이 수치는 Cycles에만 한정되며, 다른 렌더 엔진은 디노이징을 다르게 기록하거나 아예 기록하지 않습니다.
실제 운영 환경에서의 RTX 5090 VRAM
Cycles는 최대 디바이스 메모리 수치를 렌더 로그에 기록하며, 이는 근사치이긴 하지만 프로덕션 VRAM 수요를 가늠하는 데 유용한 지표입니다. 해당 기간 RTX 5090 노드에서 이 값이 기록된 57건의 Cycles 작업을 기준으로, 최대 렌더 디바이스 메모리는 중앙값 약 5.6GB, 90번째 백분위수 11.5GB였습니다. 이전 세대 카드는 10~12GB급이므로 중앙값 작업은 여유 있게 처리되었겠지만, 90번째 백분위수 작업은 이미 그 한계에 근접한 수준이었습니다.
이보다 더 극단적인 경우도 있습니다: 기록된 작업 중 가장 무거운 작업은 약 37.6GB를 사용했는데, 이는 RTX 5090 자체의 온보드 메모리 32GB보다 많습니다. GPU 렌더링에서 이 정도 크기의 씬은 그냥 들어맞지 않습니다: 렌더러는 초과분을 PCIe를 통해 호스트 시스템 메모리로 오버플로하며 이 경우 속도가 크게 저하되거나, 아예 렌더링이 되지 않습니다. 어느 쪽이든 이는 미리 계획해 두어야 할 실질적인 한계입니다. 저희가 VRAM 용량을 중앙값이 아니라 최대치 기준으로 산정하는 이유는, 씬이 그만큼의 용량을 필요로 하는 날 12GB 카드와 32GB 카드의 차이가 곧 렌더링이 되느냐 안 되느냐의 차이이기 때문입니다.
RTX 5090 전력 소비와 프레임당 에너지
RTX 5090은 575W급으로 정격되어 있지만, 지속적인 렌더링 부하 상태에서 저희가 측정한 실제 소비 전력은 카드당 약 360375W였으며, 최대치는 약 400W에 근접했고 온도는 섭씨 6883도였습니다. 실제로 소비되는 전력과 발열이 존재하지만, 정격 최대치보다는 예측 가능한 범위 내의 수치입니다.
이 제한된 소비 전력 수준에서, 여기 소개된 Cycles 프레임의 중앙값은 약 24초 만에 완료되며, 이는 완성된 프레임당 약 2.5Wh 수준입니다. 저희는 RTX 5090 쪽만 계측했으므로, 프레임당 에너지 수치는 측정된 전력과 측정된 렌더 시간에서 도출한 타당한 추정치로 받아들여야 하며, 이전 세대와 직접 비교 측정한 값은 아닙니다.
이 수치가 말하지 않는 것
이 수치는 단일 노드, Cycles 한정, 관찰 기반 프로덕션 데이터입니다. 정해진 7주 기간 동안의 Super Renders Farm 프로덕션 큐를 설명할 뿐, 다른 렌더 엔진이나 다른 하드웨어 세대, 작업 구성이 다른 렌더팜에 일반화해서는 안 됩니다. 저희는 통제된 현세대 GPU 비교 결과를 발표한 적이 없으며, 이는 별도의 통제된 실험으로 다른 기회에 다룰 사안입니다. 부트스트랩 및 상관계수 계산을 포함한 전체 방법론은 위에서 언급한 CGW 현장 보고서에 문서화되어 있습니다.
FAQ
Q: RTX 5090은 이전 세대 노드 대비 중앙값 기준으로 얼마나 빨라졌나요? A: Blender Cycles GPU 렌더링 기준으로 중앙값 3.2배입니다. 1,419건의 렌더 작업에서 추출한 38쌍의 프로덕션 씬을 바탕으로 했으며, 중앙값에 대한 부트스트랩 95% 신뢰구간은 3.0배에서 3.3배입니다.
Q: 3.2배라는 수치는 실험실 벤치마크인가요, 아니면 프로덕션 데이터인가요? A: 인위적으로 준비한 벤치마크 씬이 아니라, 2026년 4월과 5월에 걸쳐 실제 운영 중인 Super Renders Farm 렌더 큐에서 뽑아낸 프로덕션 데이터입니다.
Q: RTX 5090 노드에서 실제 프로덕션 Cycles 씬은 VRAM을 얼마나 사용하나요? A: 해당 값이 기록된 57건의 Cycles 작업을 기준으로 중앙값은 약 5.6GB, 90번째 백분위수는 약 11.5GB였으며, 가장 무거운 단일 작업은 약 37.6GB를 기록해 카드의 32GB를 초과했습니다. 이 정도 크기의 씬은 초과분을 PCIe를 통해 호스트 시스템 메모리로 오버플로하며 이 과정에서 속도가 크게 저하되거나, 아예 렌더링되지 않습니다.
Q: AI 디노이징은 RTX 5090이 새롭게 도입한 기능인가요? A: 아닙니다. RTX 5090 노드와 이전 세대 노드 모두에서 Cycles 작업의 약 83%가 AI 디노이징을 사용했으며, 신형 하드웨어가 도입되기 전부터 이미 표준으로 자리 잡고 있었습니다.
Q: 테스트 기간 동안 GPU 드라이버는 얼마나 안정적이었나요? A: 드라이버 버전 581.80(CUDA 13.0 기반) 하나가 51일 전체 기간 동안 롤백이나 중간 교체 없이 운영되었습니다.
Q: 이 데이터에는 다른 현세대 GPU와의 비교도 포함되어 있나요? A: 아닙니다. 이 데이터 세트의 기준선은 이전 세대인 RTX 3080급 하드웨어입니다. 다른 현세대 카드와의 통제된 비교는 이번 연구 범위에 포함되지 않았습니다.
Q: 방법론까지 포함된 전체 현장 보고서는 어디에서 볼 수 있나요? A: 저희 현장 보고서는 Computer Graphics World의 SIGGRAPH 2026 호에 실렸습니다. CGW 2026년 4·5·6월 디지털판에서 확인하실 수 있습니다. 동일한 배포 환경을 다룬 영상 워크스루도 함께 제공됩니다.
관련 기사
RTX 5090 GPU 클라우드 렌더링 성능에서는 저희 렌더팜에서의 RTX 5090 성능 전반을 더 폭넓게 다룹니다. 온보드 VRAM 한계를 넘어서는 씬에 대해서는 복잡한 씬에서의 RTX 5090 VRAM 한계를 참고해 주십시오. 기반이 되는 하드웨어 옵션에 대해서는 GPU 클라우드 렌더링을 참고해 주십시오.
About Richard Ta
Richard Ta is co-founder and technical lead of Super Renders Farm (superrendersfarm.com), a fully managed cloud render farm that supports Maya, 3ds Max, Cinema 4D, Blender, and Houdini across the major render engines. He has spent over a decade building and running large-scale CPU and GPU render infrastructure for studios in more than 50 countries.


