Rona

vLLM과 Docker를 활용한 고성능 AI SaaS GPU 백엔드 구축하기

중급502026-04-18

vLLM과 Docker를 활용하여 GPU 기반의 고성능 AI 모델 추론 환경을 구축하고 API 연동 테스트를 수행합니다. Docker Compose로 구성된 vLLM 서버와 서버의 정상 동작을 확인하는 Python 클라이언트 스크립트가 최종 결과물로 생성됩니다.

이 코칭은 터미널에서 진행됩니다

이런 걸 배워요

  • Docker를 사용하여 vLLM 추론 환경을 컨테이너화할 수 있습니다.
  • Docker Compose를 통해 GPU 자원을 활용하는 서비스를 정의하고 실행할 수 있습니다.
  • vLLM의 OpenAI 호환 API 엔드포인트 사용법을 이해하고 테스트할 수 있습니다.
  • 컨테이너 네트워크를 통해 서비스 간 통신을 구현할 수 있습니다.

어떻게 진행해요

1. 프로젝트 환경 및 Dockerfile 준비하기
2. Docker Compose로 서비스 구성하기
3. Docker 이미지 빌드하기
4. 추론 서버 실행 및 상태 확인하기
5. 서버 테스트용 클라이언트 코드 작성하기
6. 클라이언트 서비스 Docker Compose에 추가하기
7. 테스트 클라이언트 실행 및 결과 확인하기
8. 리소스 정리하기

AI 튜터가 각 단계를 하나씩 안내해줄 거예요