본문 바로가기
성공지식백과 로고성공지식백과
GLOSSARY

vLLM

고급자동화

이 페이지는 자동화 문맥에서 자주 쓰이는 vLLM의 뜻과 쓰임을 고급 난이도 기준으로 정리한 AI 용어사전 항목입니다. 정의와 맥락, 관련 용어 6개 순서로 묶었으니, 아래 설명을 먼저 읽고 연결된 개념과 글까지 이어서 보면 이해가 빨라집니다.

vLLM은 대규모 언어 모델을 빠르게 서빙하기 위한 오픈소스 라이브러리입니다. UC 버클리의 Sky Computing Lab에서 시작해 지금은 여러 대학과 기업이 함께 개발하는 프로젝트로 커졌고, 2,000명이 넘는 기여자가 참여하고 있습니다. 가중치가 공개된 모델을 사내 GPU에 올려 여러 사용자에게 서비스하려 할 때 사실상 표준처럼 쓰입니다.

PagedAttention이 푼 문제

vLLM의 출발점은 KV 캐시 관리였습니다. 기존 방식은 요청마다 '이 대화가 최대 몇 토큰까지 갈지'를 가정해 메모리를 미리 통으로 잡았습니다. 실제 대화가 짧게 끝나면 잡아 둔 공간이 그대로 낭비되고, 요청마다 크기가 달라 빈 공간이 잘게 조각나 새 요청을 받지 못하는 상황도 생깁니다. GPU 메모리의 상당 부분이 이런 식으로 놀고 있었습니다.

PagedAttention은 운영체제의 가상 메모리에서 아이디어를 가져왔습니다. KV 캐시를 고정 크기 블록으로 쪼개고, 논리적으로는 이어져 있지만 물리적으로는 흩어진 자리에 저장합니다. 미리 크게 잡을 필요가 없으니 낭비가 사라지고, 남는 메모리로 더 많은 요청을 동시에 처리할 수 있습니다. 같은 접두사를 공유하는 요청들끼리 블록을 함께 쓰는 것도 이 구조 덕분에 자연스럽게 가능해집니다.

그 밖의 주요 기능

vLLM은 요청이 끝날 때까지 기다리지 않고 빈자리가 생기는 대로 새 요청을 끼워 넣는 연속 배치(continuous batching)를 씁니다. 긴 프롬프트를 잘라 나눠 처리하는 chunked prefill, 같은 앞부분을 재사용하는 프리픽스 캐싱도 기본으로 들어 있습니다. FP8, INT8, INT4, GPTQ, AWQ 같은 양자화 형식을 지원하고, 텐서·파이프라인·데이터·엑스퍼트 병렬을 조합해 여러 장의 가속기에 모델을 나눠 올릴 수 있습니다.

실무에서 특히 편한 부분은 OpenAI 호환 서버입니다. 명령 한 줄로 서버를 띄우면 기존 OpenAI SDK 코드에서 주소만 바꿔 그대로 호출할 수 있어, 애플리케이션을 고치지 않고 백엔드 모델만 교체하는 실험이 가능합니다. 스트리밍구조화된 출력도 지원하며, 200종이 넘는 모델 아키텍처를 다룹니다.

PagedAttention과 연속 배치가 함께 맞물리면서 처리량 차이가 크게 벌어집니다. 요청 하나하나의 응답 속도가 극적으로 빨라진다기보다, 같은 시간에 처리할 수 있는 요청 수가 늘어나는 쪽에 가깝습니다. 사용자가 몰릴 때 대기열이 길어지지 않는다는 뜻이라, 사내 도구처럼 사용자가 동시에 몰리는 환경에서 체감 차이가 특히 큽니다.

Ollama와 어떻게 다른가

둘 다 모델을 로컬에서 돌린다는 점은 같지만 겨냥하는 상황이 다릅니다. Ollama는 한 사람이 자기 PC에서 모델을 내려받아 바로 써 보는 데 최적화되어 있어 설치와 사용이 간단합니다. vLLM은 여러 사용자의 요청을 동시에 받아 처리량을 뽑아내는 서버용이라, 설정할 항목이 많은 대신 같은 GPU로 훨씬 많은 요청을 감당합니다. 개인 실험은 Ollama, 팀·사내 서비스는 vLLM으로 나누는 구분이 무난합니다.

도입 전에 확인할 것은 메모리 계산입니다. 모델 가중치가 GPU 메모리를 얼마나 차지하는지, 남은 공간으로 몇 명의 KV 캐시를 감당할 수 있는지가 동시 처리량을 결정합니다. 최대 컨텍스트 길이를 모델 사양 그대로 열어 두면 동시 요청 수가 급격히 줄어드는 경우가 많으므로, 실제 필요한 길이로 제한하는 것이 추론 서버 운영의 기본입니다.

어디에 올릴지도 미리 정해 두는 편이 좋습니다. 컨테이너 이미지로 배포하는 구성이 일반적이라 Docker와 쿠버네티스 위에 얹는 사례가 많고, 이때 모델 가중치를 어디에 두고 어떻게 캐시할지가 배포 시간을 좌우합니다. 수십 기가바이트짜리 파일을 매번 내려받는 구조로 만들면 재배포마다 긴 대기가 생깁니다.

정리하면 vLLM은 모델을 더 똑똑하게 만드는 도구가 아니라, 같은 모델을 같은 하드웨어에서 더 많이 돌리게 해 주는 도구입니다. 공개 가중치 모델을 쓰기로 결정한 순간부터 실질적인 비용은 모델 라이선스가 아니라 GPU 시간에서 나오기 때문에, 서빙 엔진 선택이 곧 운영비 선택이 됩니다.

RELATED TERMS

관련 용어

vLLM와 함께 자주 언급되는 개념들입니다. 비슷한 말처럼 보여도 역할과 쓰임은 다를 수 있습니다.