Orchestrer l’inférence LLM à grande échelle : ressources, serving et montée en charge
Comprendre comment répartir les responsabilités entre ordonnanceurs de ressources, moteurs d’inférence et couches de serving, puis concevoir un déploiement LLM capable d’absorber la charge tout en maîtrisant latence, mémoire GPU et résilience.