같은 GPU로 네 배를 처리한다 — LG유플러스가 꺼낸 AI 비용 절감 카드의 정체를 파헤친다

4배 — 같은 GPU에서 처리할 수 있는 토큰량 (기존 대비 최대, LG유플러스·옵트에이아이 연구 성과)

78%↓ — 엑사원 기반 소형언어모델(sLM)의 전력 소모 절감폭 (CPU 구동 대비, 동등 성능 유지)

82%↓ — 모델 크기 축소폭 (스마트폰 NPU 구동 성공)

AI 챗봇에 질문을 던질 때마다 어딘가에선 GPU가 전기를 먹고 있다. 답이 길어질수록, 사용자가 늘어날수록 전기요금표는 가파르게 올라간다. AI 업계의 고민은 이제 '얼마나 똑똑한가'에서 '얼마나 싸게 돌릴 수 있는가'로 옮겨가는 중이다. LG유플러스가 10월 2일 꺼낸 카드가 바로 이 지점을 찌른다. AI 모델 최적화 기업 옵트에이아이와 손잡고 '토큰 최적화' 기술 고도화에 나선다고 밝혔다(IT조선 보도).

토큰이 뭐길래 비용이 되나?

토큰은 AI가 질문을 이해하고 답변을 만들 때 처리하는 데이터의 최소 단위다. 한 문장을 여러 조각으로 나눈 것이라 생각하면 쉽다. 토큰을 많이 처리할수록 GPU 연산이 늘고, 전력과 시간이 든다. 토큰 최적화는 모델을 가볍게 만들거나 연산 과정을 효율화해, 같은 자원으로 더 많은 요청을 처리하는 기술이다. 양사는 서버 GPU 환경에서 AI가 답변을 생성하는 연산 과정을 실제 서비스에 맞게 다듬어, 같은 GPU에서 처리하는 토큰량을 기존보다 최대 4배까지 끌어올렸다고 밝혔다(더팩트 보도).

데이터 흐름이 하나의 칩으로 모이는 모습 — 토큰 최적화의 개념을 표현한 이미지
데이터 흐름이 하나의 칩으로 모이는 모습 — 토큰 최적화의 개념을 표현한 이미지. 사진은 AI 생성 이미지.

그래서 뭐가 달라지나?

이미 검증된 성과가 있다. 양사는 엑사원(EXAONE) 기반 소형언어모델에 경량화 기술을 적용해 스마트폰의 AI 전용 반도체(NPU)에서 구동하는 데 성공했다. CPU 방식과 같은 수준의 성능을 유지하면서 전력 소모는 78%, 모델 크기는 82% 줄였다. 이번엔 이 노하우를 데이터센터의 서버 GPU로 넓히는 것이다. 양사는 10월 1일 'Efficient AI 테크 세미나'를 공동 개최해 퓨리오사AI, 베슬에이아이, 한국전자기술연구원, 한양대와 연구 동향을 공유했고, 확보한 기술은 고객 상담 챗봇 등 대고객 AI 서비스와 대규모 인프라에 단계적으로 적용할 계획이다(뉴데일리 보도).

"AI 경쟁력은 단순히 성능을 높이는 것을 넘어 같은 자원으로 얼마나 많은 토큰을 효율적으로 처리할 수 있느냐에 달려 있다" — 이상엽 LG유플러스 CTO(더팩트 보도, 10월 2일)

스마트폰과 데이터센터 — 온디바이스 AI와 서버 GPU의 대비를 표현한 이미지
스마트폰과 데이터센터 — 온디바이스 AI와 서버 GPU의 대비를 표현한 이미지. 사진은 AI 생성 이미지.

선택 기준. AI 서비스를 고를 땐 '얼마나 똑똑한가'만큼 '얼마나 효율적으로 도는가'를 보자. 운영 효율은 곧 응답 속도와 이용료로 이어진다. 같은 일을 더 적은 GPU로 해내는 기업이 다음 라운드의 가격을 정한다.

AI의 다음 경쟁은 크기가 아니라 다이어트다.