vram · live
Настройки GPU
OCR GLM через vLLM (страницы параллельно) или Mistral API. На одной L4 Qwen и GLM-OCR не живут awake одновременно — sleep/unload одного, load другого.
OCR
GLM-OCR — vLLM continuous batching (сервис vllm-ocr, образ ≥ 0.11). HF Transformers остаётся fallback (OCR_INFER=hf), но без многопотока. mistral — облако. На L4: сначала sleep LLM, потом «загрузить OCR» (wake vllm-ocr), или VLLM_OCR_REPLICAS=1 и VLLM_REPLICAS=0.
- model
- —
- infer
- —
- vllm
- —
- device
- —
- last
- —
- loaded_at
- —
- unloaded_at
- —
- error
- —
LLM
vLLM: sleep level=1 снимает веса с GPU (нужен --enable-sleep-mode). Ollama: keep_alive=0.
- kind
- —
- model
- —
- base
- —
- sleep API
- нет
- sleeping
- —
- error
- —
Процессы GPU
| pid | name | mem | uuid |
|---|---|---|---|
| нет compute-процессов | |||
pmon (sm / mem)
| gpu | pid | sm% | mem% | cmd |
|---|---|---|---|---|
| нет выборки pmon | ||||
Сервисы
| name | ok | ms | http | error |
|---|
vLLM metrics
| metric | value |
|---|---|
| нет prometheus /metrics | |
Torch (процесс OCR)
- torch
- —
- cuda
- —
- cudnn
- —
Действия
ожидание
пока пусто