GPU 노드 운영의 기본부터 모델 서빙 아키텍처까지서버가 느려졌다는 연락을 받으면 CPU 사용률, 메모리 사용량, 디스크 사용량 같은 인프라 지표를 확인하는 게 일반적인 운영의 시작이다. 하지만 2026년 현재, 인프라 엔지니어가 마주하는 문제는 조금 달라졌다. GPU 활용도, 모델 서빙 지연 시간, 토큰당 비용 같은 새로운 지표들이 일상적으로 등장한다.생성형 AI가 프로덕션에 진입하면서 인프라 설계의 기본 가정 자체가 바뀌고 있다. GPU는 CPU와 근본적으로 다르고, 모델 서빙은 REST API와 다르며, 토큰 기반 과금은 요청 수 기반 과금과 완전히 다른 경제학을 만든다. 웹 서비스를 운영하던 방식을 그대로 AI에 적용하면 실패한다.이 글에서는 AI 워크로드를 위한 인프라 설계의 기본을 다룬다. G..