새소식

AI

LLM 스터디 1주차) 모델 서빙과 최적화 입문

CloudNet@ 팀의 가시다님께서 Leading 하시는 LLM Study 1주차 스터디 내용 정리

 

 

1.1. 요약

1.1.1. LLM 모델

LLM 모델은 단순한 가중치 파일뿐만 아니라 모델 구조, 실행 코드까지 결합된 실행 가능한 소프트웨어

 

  • 모델 데이터 (가중치 파일)
    - 학습된 매개변수 + 정적 설정 + 실행 메타데이터

    - 매개변수 (Weight, Bias)
    - 설정 (Configuration, Embedding 정보, 클래스 정보)
    - 메타데이터 (Batch 크기, Tensor 정의)
  • 모델 구조
    - 신경망이 어떻게 연결되는지 정의

    - 모델 데이터가 입력되었을 때, 계산 경로 및 모델 구현 코드 구조 결정
  • 실행 코드
    - 가중치와 모델 구조를 이용해 실제로 계산 수행

 

1.1.2. 모델 서빙

LLM 모델을 API 형태로 제공하고, 트래픽 증가에 맞게 확장

지연시간, 처리량, 안정성, 보안, 비용 관리를 위한 시스템 엔지니어링 영역

 

  • 모델 서빙 라이프사이클
    - 입력 요청 수신 → 모델 실행 → 예측 결과 반환
  • LLM 서빙 핵심
    - 토큰 생성 방식, KV Cache, Attention 비용, batching, decoding, GPU memory 병목 이해
    - LLM 지식 필수

    - Transformers 에 대한 이해 (AI 알고리즘)
  • Why Model Serving?
    - 모델 서빙의 원리를 이해해야 최적의 선택 가능

    - 클라우드 벤더가 관리형 엔드포인트를 제공하더라도, 모델 서빙을 이해하지 못하면 제대로 관리하기 어려움
    - 클라우드나 LLM API 를 그대로 써도 되지만 서빙의 원리를 이해해야 비용, 보안, 성능 면에서 최적의 판단 가능
    • 인프라 측면: 어떤 모델을 어떤 인프라에 배포할지
    • 성능 측면: Latency 와 Throughput 목표 관리
    • 비용 측면: CPU/GPU/Memory 비용 통제
    • 가용성 측면: Autoscaling, Routing 설계 관리
    • 운영 측면: 모니터링, 보안, 장애 대응
  • LLM 서빙 최적화가 중요한 이유
    - 모델 배포 후 운영 단계에서의 이슈 해결

    - 부하가 걸릴 경우 지연시간(Latency) 증가
    - 처리량(Throughput)이 하드웨어 성능보다 훨씬 낮은 수준에서 정체
    - 사용량이 늘수록 비용이 선형적으로 증가
  • 모델 서빙 최적화 작업 - 비용을 통제하면서 서빙 효율을 극대화
    - 낮은 지연시간(Latency)

    - 높은 처리량(Throughput)
    - 높은 GPU 활용률
    - 낮은 비용(Cost per Request)
    - 안정적인 Tail Latency
    - 효율적인 메모리 사용
    - 특히 LLM 은 연산 요구량이 매우 커서 운영 비용 부담이 큼 → LLM 서빙 최적화는 선택이 아닌 필수

 

1.2. 모델 서빙 방식

1.2.1. On-Device / Edge Serving

모델을 서버가 아니라 사용자 기기에서 직접 실행

사용자 기기: 스마트폰, 드론, 카메라, 로봇

 

On-Device 핵심 구성 요소
  • 모델 런타임(Model Runtime): 모델을 실행할 수 있도록 하는 소프트웨어 계층
  • 모델 래퍼(Model Wrapper): 런타임과 상호작용하여 모델 호출

 

1.3.2. Single-model Service

단일 모델 서비스모델 하나 또는 모델 버전 하나를 전용 서비스로 배포

클라우드 기반 모델 서빙에 사용되는 클래식 패턴

독립된 웹 서비스 배포 → API 노출 → API 요청을 통한 추론 백엔드 라우팅

 

구성요소
  • API Server: HTTP/gRPC 로 추론 기능을 외부에 노출
  • Model Management: 모델 다운로드 → 로컬 저장소 추출 → 추론 백엔드에 로딩
  • Inference Backend: 실제 모델 실행

 

 

1.3.3. Multi-model Service

컨테이너 하나가 여러 모델을 공유해서 실행

1개의 서빙 컨테이너 안에 여러 모델을 함께 호스팅

GPU/CPU/메모리를 모델들끼리 공유

트래픽에 따른 동적 모델 로딩 방식

 

구성요소
  • Model Server Inference Backend
    - 프레임워크가 달라도 API 로 처리하는 역할

    - 내부적으로 프레임워크별 백엔드를 갖고 있음
  • Model Cache Management
    - 모델 저장소에서 모델 다운로드 후 추론 백엔드로 로드

    - LRU(Least Recently Used) 캐시를 통해 가장 적게 쓰인 모델을 언로드

 

1.3.4. Model Serving Platform

여러 모델들을 조합해서 자동으로 실행하면서 GPU/CPU 를 효율적으로 공유하도록 관리해주는 시스템

오케스트레이션 + 리소스 그룹 + 워크플로우

 

1.4. vLLM

LLM 을 위한 고처리량, 메모리 효율적 추론 및 서빙 엔진

 

LLM 서빙 최적화를 위한 오픈소스 프레임워크

 

vLLM 의 주요 기능
  • PagedAttention
    - KV Cache 를 페이지로 나누어 관리 → KV Cache 메모리 사용량 감소
  • Continuous Batching
    - 요청이 완료되면 즉시 배치에서 제거하고 새 요청 추가 → 처리량 증가(Throughput)
  • OpenAI-compatible API Server
    - OpenAI API 와 동일한 인터페이스 제공
  • Tensor Parallelism
    - 하나의 모델을 여러 GPU 에 분산해서 실행

 

1.4. 요약

  • LLM 모델은 모델 구조, 실행 코드까지 결합된 실행 가능한 소프트웨어
  • 모델 서빙은 LLM 모델 배포 후 운영 최적화에 필요한 방법

 

모델 서빙 아키텍처 4가지
  1. 온디바이스
  2. 싱글모델
  3. 멀티모델
  4. 모델서빙플랫폼
  • vLLM: 대표적인 LLM 배포 오픈소스 프레임워크

'AI' 카테고리의 다른 글

Claude Code Workshop - Chapter 2 Subagents  (0) 2026.08.09
LLM 스터디 1주차) LLM Transformer  (0) 2026.08.08
Claude Code Workshop - Chapter 1 Overview  (0) 2026.08.01
Contents

포스팅 주소를 복사했습니다