AI 경쟁인데 왜 GPU를 더 사는 대신 같은 GPU가 더 일하게 만들까

LG유플러스는 AI 모델 최적화 기업 옵트에이아이와 서버 GPU 환경에서 토큰 최적화 기술을 공동 연구하고 있다.

LG유플러스는 현재 진행 중인 초기 연구에서 실제 서비스 환경에 맞춰 AI 모델의 연산 과정을 개선한 결과, 같은 GPU에서 처리 가능한 토큰량을 기존 대비 최대 4배 높였다고 밝혔다.

이 수치를 전사 AI 운영비가 4분의 1이 됐다는 의미로 읽어서는 안 된다. 아직 공동연구의 초기 성과다. 다만 AI 경쟁의 질문이 ‘더 큰 모델’에서 ‘같은 자원을 얼마나 효율적으로 쓰는가’로 넓어지는 방향은 분명하다.

사용자가 늘어나면 모델 성능은 곧 운영비 문제와 만난다

AI 서비스 초기에는 모델이 질문을 얼마나 잘 이해하고 정확하게 답하는지가 가장 중요하다.

하지만 실제 이용자가 늘어나면 호출 횟수가 GPU 사용량과 전력, 서버 운영비로 연결된다. LG유플러스도 AI 서비스 확산으로 GPU와 전력 등 운영비가 늘고 있어 같은 수준의 서비스를 더 적은 자원으로 제공하는 기술이 중요해지고 있다고 설명했다.

서비스가 커지는 순간 질문은 ‘이 모델이 얼마나 좋은가’에서 ‘이 모델을 수백만 번 호출해도 경제적인가’로 확장된다.

같은 GPU의 생산량을 높이는 것이 사업지표가 될 수 있다

토큰은 AI가 질문을 이해하고 답을 생성할 때 처리하는 기본 단위다. 같은 GPU에서 더 많은 토큰을 처리할 수 있다면 같은 인프라로 더 많은 요청을 받을 여지가 생긴다.

공장으로 비유하면 설비 수는 그대로인데 시간당 생산량을 높이는 것과 비슷하다. AI에서도 GPU 한 장이 처리하는 요청량, 토큰당 비용, 요청당 지연시간 같은 수치가 사업운영과 직접 연결된다.

따라서 최대 4배라는 초기 결과의 의미는 단순 속도 기록보다 기존 컴퓨팅 자원에서 더 많은 서비스 capacity를 꺼낼 가능성에 있다.

LG유플러스는 이미 스마트폰에서 ‘덜 쓰는 AI’를 시험했다

이번 협력은 서버 GPU에서 갑자기 시작된 것이 아니다. LG유플러스는 2025년 LG AI연구원, 옵트에이아이와 함께 EXAONE 3.5 기반 소형언어모델을 스마트폰 NPU에서 구동하도록 경량화했다.

회사 발표 기준 기존 CPU 방식과 같은 수준의 성능을 유지하면서 전력 소모량은 78%, 모델 크기는 82% 줄였다.

당시에는 제한된 단말 자원 안에서 AI를 돌리는 문제가 중심이었다. 이번에는 그 최적화 방향이 대규모 서버 GPU 운영으로 확대되고 있다.

Device Constraint에서 Server Constraint로 최적화의 무대가 넓어진다

온디바이스 AI에서는 작은 메모리와 배터리, 제한된 연산자원이 제약이다. 서버 AI에서는 GPU 확보량과 전력, 추론비용, 대규모 동시요청이 제약이 된다.

환경은 다르지만 문제의 형태는 비슷하다. 원하는 성능을 유지하면서 필요한 자원을 얼마나 줄일 수 있는가다.

이를 흐름으로 보면 Device Constraint → Model Compression → Server Constraint → Token Optimization으로 연결된다. AI를 만드는 문제와 AI를 경제적으로 운영하는 문제가 점점 분리되고 있다.

Build Better Models와 Run Models Better는 다른 capability다

모델 경쟁에서는 정확도와 추론성능, 벤치마크가 눈에 띈다. 하지만 production 단계에서는 모델 압축, 양자화, 추론 최적화, GPU 활용률, 서빙 구조, 지연시간 같은 영역이 중요해진다.

같은 품질의 모델이라도 한 회사가 요청 하나를 처리하는 데 더 많은 GPU 자원을 사용한다면 이용자가 늘어날수록 비용격차가 누적된다.

AI 시장이 커질수록 더 좋은 모델을 만드는 능력과 이미 있는 모델을 더 싸고 빠르게 반복 실행하는 능력이 각각 중요한 경쟁력으로 분화될 수 있다.

AI 인재시장에서도 ‘모델을 만드는 사람’만으로는 부족해진다

AI 채용에서 가장 눈에 띄는 역할은 오랫동안 연구자와 모델 엔지니어였다. 하지만 서비스 규모가 커지면 inference optimization, model compression, quantization, GPU utilization, serving infrastructure, latency optimization 같은 역할의 가치도 커진다.

이들은 반드시 새로운 파운데이션 모델을 만드는 사람이 아니다. 이미 존재하는 모델을 실제 트래픽에서 더 효율적으로 움직이게 하는 사람이다.

AI가 연구 프로젝트에서 서비스 운영으로 이동할수록 Build Better Models뿐 아니라 Run Models Better를 담당하는 시스템형 인재가 더 중요해질 수 있다.

BANSEOG VIEW | AI가 보편화될수록 ‘덜 쓰는 능력’이 경쟁력이 된다

LG유플러스와 옵트에이아이의 동일 GPU 최대 4배 토큰 처리량은 아직 진행 중인 서버 GPU 최적화 연구의 초기 성과다. 모든 모델과 모든 서비스에서 같은 효과가 난다는 의미는 아니다.

하지만 앞선 온디바이스 경량화와 이번 서버 최적화를 함께 보면 방향은 선명하다. AI 사용량이 늘어날수록 기업은 GPU를 계속 추가하는 것뿐 아니라 기존 자원을 더 효율적으로 쓰는 능력을 함께 확보해야 한다.

Banseog는 이 이동을 AI Capability → User Scale → Compute Cost → Optimization → Unit Economics로 본다. AI가 실제 사업이 될수록 같은 품질을 더 적은 자원으로 반복 실행하는 능력이 기술성능과 별개의 경쟁력이 될 수 있다.

Banseog View — AI Capability → User Scale → Compute Cost → Optimization → Unit Economics

AI 서비스가 커지면 모델 품질만큼 요청당 컴퓨팅 비용과 GPU 활용효율이 중요해진다.

LG유플러스의 흐름은 단말 NPU 최적화에서 서버 GPU 토큰 최적화로 확장되고 있다.

AI 인재시장에서도 모델 연구뿐 아니라 추론 최적화, 서빙, GPU 활용률과 같은 production capability의 가치가 커질 수 있다.

근거가 된 원자료

‘최대 4배’는 LG유플러스와 옵트에이아이의 서버 GPU 토큰 최적화 공동연구에서 공개된 초기 성과이며, 모든 AI 모델·서비스에서 동일한 배수의 성능 또는 비용절감이 보장된다는 의미가 아니다. AI Capability → User Scale → Compute Cost → Optimization → Unit Economics는 두 공식 발표를 연결해 AI 운영 경쟁을 설명한 Banseog의 분석 프레임이다.