CloudNet@ 팀의 가시다님께서 Leading 하시는 LLM Study 1주차 스터디 내용 정리
1.1. 요약
1.1.1. LLM 모델
LLM 모델은 단순한 가중치 파일뿐만 아니라모델 구조, 실행 코드까지 결합된 실행 가능한 소프트웨어
모델 데이터 (가중치 파일) - 학습된 매개변수 + 정적 설정 + 실행 메타데이터 - 매개변수 (Weight, Bias) - 설정 (Configuration, Embedding 정보, 클래스 정보) - 메타데이터 (Batch 크기, Tensor 정의)
모델 구조 - 신경망이 어떻게 연결되는지 정의 - 모델 데이터가 입력되었을 때, 계산 경로 및 모델 구현 코드 구조 결정
실행 코드 - 가중치와 모델 구조를 이용해 실제로 계산 수행
1.1.2. 모델 서빙
LLM 모델을 API 형태로 제공하고, 트래픽 증가에 맞게 확장
지연시간, 처리량, 안정성, 보안, 비용 관리를 위한 시스템 엔지니어링 영역
모델 서빙 라이프사이클 - 입력 요청 수신 → 모델 실행 → 예측 결과 반환
LLM 서빙 핵심 - 토큰 생성 방식, KV Cache, Attention 비용, batching, decoding, GPU memory 병목 이해 - LLM 지식 필수 - Transformers 에 대한 이해 (AI 알고리즘)
Why Model Serving? - 모델 서빙의 원리를 이해해야 최적의 선택 가능 - 클라우드 벤더가 관리형 엔드포인트를 제공하더라도, 모델 서빙을 이해하지 못하면 제대로 관리하기 어려움 - 클라우드나 LLM API 를 그대로 써도 되지만 서빙의 원리를 이해해야 비용, 보안, 성능 면에서 최적의 판단 가능
인프라 측면: 어떤 모델을 어떤 인프라에 배포할지
성능 측면: Latency 와 Throughput 목표 관리
비용 측면: CPU/GPU/Memory 비용 통제
가용성 측면: Autoscaling, Routing 설계 관리
운영 측면: 모니터링, 보안, 장애 대응
LLM 서빙 최적화가 중요한 이유 - 모델 배포 후 운영 단계에서의 이슈 해결 - 부하가 걸릴 경우 지연시간(Latency) 증가 - 처리량(Throughput)이 하드웨어 성능보다 훨씬 낮은 수준에서 정체 - 사용량이 늘수록 비용이 선형적으로 증가
모델 서빙 최적화 작업 - 비용을 통제하면서 서빙 효율을 극대화 - 낮은 지연시간(Latency) - 높은 처리량(Throughput) - 높은 GPU 활용률 - 낮은 비용(Cost per Request) - 안정적인 Tail Latency - 효율적인 메모리 사용 - 특히 LLM 은 연산 요구량이 매우 커서 운영 비용 부담이 큼 → LLM 서빙 최적화는 선택이 아닌 필수
1.2. 모델 서빙 방식
1.2.1. On-Device / Edge Serving
모델을 서버가 아니라 사용자 기기에서 직접 실행
사용자 기기: 스마트폰, 드론, 카메라, 로봇
On-Device 핵심 구성 요소
모델 런타임(Model Runtime): 모델을 실행할 수 있도록 하는 소프트웨어 계층
모델 래퍼(Model Wrapper): 런타임과 상호작용하여 모델 호출
1.3.2. Single-model Service
단일 모델 서비스, 모델 하나 또는 모델 버전 하나를 전용 서비스로 배포
클라우드 기반 모델 서빙에 사용되는 클래식 패턴
독립된 웹 서비스 배포 → API 노출 → API 요청을 통한 추론 백엔드 라우팅
구성요소
API Server: HTTP/gRPC 로 추론 기능을 외부에 노출
Model Management: 모델 다운로드 → 로컬 저장소 추출 → 추론 백엔드에 로딩
Inference Backend: 실제 모델 실행
1.3.3. Multi-model Service
컨테이너 하나가 여러 모델을 공유해서 실행
1개의 서빙 컨테이너 안에 여러 모델을 함께 호스팅
GPU/CPU/메모리를 모델들끼리 공유
트래픽에 따른 동적 모델 로딩 방식
구성요소
Model Server Inference Backend - 프레임워크가 달라도 API 로 처리하는 역할 - 내부적으로 프레임워크별 백엔드를 갖고 있음
Model Cache Management - 모델 저장소에서 모델 다운로드 후 추론 백엔드로 로드 - LRU(Least Recently Used) 캐시를 통해 가장 적게 쓰인 모델을 언로드
1.3.4. Model Serving Platform
여러 모델들을 조합해서 자동으로 실행하면서 GPU/CPU 를 효율적으로 공유하도록 관리해주는 시스템
오케스트레이션 + 리소스 그룹 + 워크플로우
1.4. vLLM
LLM 을 위한 고처리량, 메모리 효율적 추론 및 서빙 엔진
LLM 서빙 최적화를 위한 오픈소스 프레임워크
vLLM 의 주요 기능
PagedAttention - KV Cache 를 페이지로 나누어 관리 → KV Cache 메모리 사용량 감소
Continuous Batching - 요청이 완료되면 즉시 배치에서 제거하고 새 요청 추가 → 처리량 증가(Throughput)
OpenAI-compatible API Server - OpenAI API 와 동일한 인터페이스 제공