Choorai
Lv.4 · Inference

Local LLM

Local LLM은 비용, 보안, 오프라인, 실험 속도 때문에 선택합니다. 처음은 Ollama로 빠르게 확인하고, GPU 서버에서 처리량이 필요하면 vLLM을 비교합니다.

먼저 정할 것

모델을 띄우기 전에 “어떤 기능의 어떤 품질 기준을 통과해야 하는가”를 정하세요. 하네스 없이 로컬 모델만 바꾸면 판단이 흐려집니다.

Ollama 빠른 실험

terminal
ollama pull llama3.1
ollama run llama3.1

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.1",
    "messages": [{ "role": "user", "content": "hello" }]
  }'

vLLM 서버 실험

terminal
vllm serve meta-llama/Llama-3.1-8B-Instruct \
  --host 0.0.0.0 \
  --port 8000

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta-llama/Llama-3.1-8B-Instruct",
    "messages": [{ "role": "user", "content": "hello" }]
  }'

선택 기준

Ollama

개인 개발, 빠른 모델 교체, Mac/로컬 실험에 좋습니다.

vLLM

GPU 서버, OpenAI 호환 서버, 동시 요청 처리량 비교에 좋습니다.

Hosted API

최신 모델 품질, 운영 안정성, 빠른 제품 검증에 유리합니다.

Gateway

여러 모델을 base URL과 라우팅 정책으로 교체할 때 필요합니다.

다음 액션

마지막 업데이트: 2026년 6월 22일 · 버전: v0.0.1

피드백 보내기

입력한 내용으로 새 이슈 페이지를 엽니다.

GitHub 이슈로 보내기