vram · live

Настройки GPU

OCR GLM через vLLM (страницы параллельно) или Mistral API. На одной L4 Qwen и GLM-OCR не живут awake одновременно — sleep/unload одного, load другого.

VRAM—%— / —
OCR…— · inflight —
LLM…— ·
aicore…—

OCR

GLM-OCR — vLLM continuous batching (сервис vllm-ocr, образ ≥ 0.11). HF Transformers остаётся fallback (OCR_INFER=hf), но без многопотока. mistral — облако. На L4: сначала sleep LLM, потом «загрузить OCR» (wake vllm-ocr), или VLLM_OCR_REPLICAS=1 и VLLM_REPLICAS=0.

model
—
infer
—
vllm
—
device
—
last
—
loaded_at
—
unloaded_at
—
error
—

LLM

vLLM: sleep level=1 снимает веса с GPU (нужен --enable-sleep-mode). Ollama: keep_alive=0.

kind
—
model
—
base
—
sleep API
нет
sleeping
—
error
—

Процессы GPU

pidnamememuuid
нет compute-процессов

pmon (sm / mem)

gpupidsm%mem%cmd
нет выборки pmon

Сервисы

nameokmshttperror

vLLM metrics

metricvalue
нет prometheus /metrics

Torch (процесс OCR)

torch
—
cuda
—
cudnn
—

Действия

ожидание

пока пусто