Santa Rally Local LLM Console
서버 상태
metrics 대기 중요청 속도와 CPU/RAM 상태를 함께 보면서 응답 지연의 원인을 확인합니다.
CPU
-
load -
RAM
-
-
Active
-
proxied requests
RPM
-
last 60s
Latency
-
p95 -
Tok/s
-
last completion
최근 요청 latency / count
CPU / RAM
Chat
/v1/chat/completions일반 질의응답과 스트리밍 출력의 품질, latency, token 속도를 확인합니다.
Image input
multimodal이미지와 텍스트를 함께 넣었을 때 Gemma 4의 vision 입력 처리를 확인합니다.
이미지를 선택하면 여기에 미리보기가 표시됩니다.
Completion
/v1/completionsOpenAI legacy completion 형식으로 단일 prompt 이어쓰기를 확인합니다.
Tokenize
/tokenize입력 텍스트가 모델 tokenizer에서 몇 개의 token으로 쪼개지는지 확인합니다.
Models
/v1/models현재 서빙 중인 모델 이름과 서버 health 응답을 확인합니다.
Unsupported probes
probe only현재 미지원인 이미지 생성과 embedding endpoint가 어떤 응답을 주는지 확인합니다.