Base model
Qwen2.5-14B
Apache 2.0 · adapter v12 (LoRA)
Serving
vLLM · 2× L4
p95 1.9s · 99.7% uptime
GPU cost / mo
$1,140
vs est. hosted API $3,400
Escape hatch
Adapter I/F
hosted API swappable per task
Eval rubric - local v12 vs hosted baseline (held-out set, blind-scored)
▮ local · | hosted baseline - open-ended gap accepted: no product surface depends on it (tasks are narrow & tuned)
Human feedback (30d)
Triage override drift > 10% - retune suggested
Adapter registry