Santa Rally Local LLM Console

OpenAI-compatible No-key public test gemma-4-26b-a4b-it Docs Monitor

서버 상태

metrics 대기 중

요청 속도와 CPU/RAM 상태를 함께 보면서 응답 지연의 원인을 확인합니다.

CPU
-
load -
RAM
-
-
Active
-
proxied requests
RPM
-
last 60s
Latency
-
p95 -
Tok/s
-
last completion
최근 요청 latency / count
CPU / RAM

Chat

/v1/chat/completions

일반 질의응답과 스트리밍 출력의 품질, latency, token 속도를 확인합니다.

Image input

multimodal

이미지와 텍스트를 함께 넣었을 때 Gemma 4의 vision 입력 처리를 확인합니다.

preview
이미지를 선택하면 여기에 미리보기가 표시됩니다.

Completion

/v1/completions

OpenAI legacy completion 형식으로 단일 prompt 이어쓰기를 확인합니다.

Tokenize

/tokenize

입력 텍스트가 모델 tokenizer에서 몇 개의 token으로 쪼개지는지 확인합니다.

Models

/v1/models

현재 서빙 중인 모델 이름과 서버 health 응답을 확인합니다.

Unsupported probes

probe only

현재 미지원인 이미지 생성과 embedding endpoint가 어떤 응답을 주는지 확인합니다.