Model ops - AI layer Serving healthy
Eval history Queue retune (v13)

Base model

Qwen2.5-14B

Apache 2.0 · adapter v12 (LoRA)

Serving

vLLM · 2× L4

p95 1.9s · 99.7% uptime

GPU cost / mo

$1,140

vs est. hosted API $3,400

Escape hatch

Adapter I/F

hosted API swappable per task

Eval rubric - local v12 vs hosted baseline (held-out set, blind-scored)

Playbook accuracy
8.8 /9.1 Draft usability
9.0 /8.9 Reply classification F1
.94 /.92 Open-ended reasoning
7.1 /9.0

▮ local · | hosted baseline - open-ended gap accepted: no product surface depends on it (tasks are narrow & tuned)

Human feedback (30d)

Composer accept / edit / reject64 / 29 / 7%
Damage detection accept87%
Inbox triage overrides11% ↑

Triage override drift > 10% - retune suggested

Adapter registry

v12 · activeJun 30
v11 · rollback targetJun 2
v13 · training queuepending