Všechny projekty

model-pro(vider)

Self-hosted, OpenAI-kompatibilní inferenční brána nad lokálními enginy, image workerem a cloudovými poskytovateli.

Příprava vydání

Jeden endpoint a jeden seznam modelů před každým backendem. Požadavek na nenačtený model nastartuje správný engine, načte ho a vyklidí to, co právě drží GPU; cloudové modely nespotřebovávají žádnou VRAM a nikdy nic nevyklízejí. Nikdy tiše nepodstrčí jiný model: typované chyby, ne překvapivé modely. Kontextové úrovně vybírají nejmenší konfiguraci, která požadavek pokryje, místo načítání předimenzované, a rekonciliace mimo hlavní tok převezme to, co skutečně běží, když se backend restartuje za zády proxy.

Je jediným držitelem klíčů poskytovatelů, takže aplikace pojmenovávají modely a nikdy nevidí tajemství, a každý volající se musí identifikovat. Virtuální jména se rozkládají po uspořádaném seznamu preferencí s fallbackem. Evaluační harness přehrává reálné sessions jako nezávislé rollouty per kandidátní model a označí popisy nástrojů, na kterých se modely shodnou mezi sebou, ale ne s člověkem, protože to bývá chyba nástroje.

Python, FastAPI, CUDA, TabbyAPI, llama.cpp, Ollama, FLUX