Skip to main content
HuggingFace에서 개발한 LLM 추론 서버입니다. HuggingFace 모델 허브와 긴밀하게 통합되어 있으며, Flash Attention, 양자화 등 최적화 기술을 지원합니다.

어디에 쓰이나요?

  • HuggingFace 모델 서빙: HuggingFace Hub의 모델을 바로 API로 서빙
  • 텍스트 생성 API: OpenAI API 호환 형식으로 챗봇, 텍스트 생성 서비스 구축
  • 스트리밍 응답: Server-Sent Events(SSE) 기반의 실시간 토큰 스트리밍
  • 프로덕션 배포: HuggingFace Inference Endpoints의 백엔드로 사용되는 검증된 엔진
NVIDIA GPU가 필수입니다. GPU가 없는 환경에서는 실행되지 않습니다.

Docker Compose

docker-compose.yml

실행

모델 다운로드 후 서버가 시작됩니다. 로그로 진행 상태를 확인합니다.

접속 확인

기본 정보

주요 실행 옵션

라이선스

참고

설치 점검 목록

  • docker compose up -ddocker compose ps로 컨테이너 상태를 확인했습니다.
  • 기본 포트/계정/비밀번호를 문서대로 점검했습니다.
  • 운영용으로 사용할 때 기본 비밀번호/시크릿 값을 변경했습니다.
  • 장애 분석을 위해 docker compose logs -f 확인 방법을 숙지했습니다.

문제 해결 가이드

  • 컨테이너가 실행되지 않으면 docker compose logs -f로 오류 원인을 먼저 확인합니다.
  • 포트 충돌이 나면 기존 프로세스를 종료하거나 포트 매핑 값을 변경합니다.
  • 이미지 pull 실패 시 네트워크 연결 및 레지스트리 접근 권한을 확인합니다.
  • 설정 변경 후 문제가 지속되면 docker compose down 후 다시 up -d로 재기동합니다.

관련 문서

Setup 홈

운영체제별 설치 흐름을 다시 확인합니다.

다음: TEI (Text Embeddings Inference)

다음 설치 단계를 이어서 진행합니다.