Restaurer la capacité d'inférence LLM en secondes avec Shadow Engine Recovery dans NVIDIA Dynamo
HERALD · Artificial Intelligence
Lorsque le processus moteur LLM échoue, le chemin de récupération standard implique un redémarrage froid. Cela nécessite le chargement des poids dans la HBM depuis le stockage, la compilation des kernels et la réinitialisation de l'état d'exécution. NVIDIA Dynamo introduit Shadow Engine Recovery, un mécanisme conçu pour restaurer la capacité d'inférence en quelques secondes plutôt qu'en minutes. Cette approche exploite des instances d'ombre pré-chauffées qui reflètent l'état du moteur actif, permettant un basculement rapide sans la charge d'un redémarrage froid complet. Cette capacité est critique pour les charges de travail de service LLM en production où le temps d'arrêt impacte directement l'expérience utilisateur et la conformité SLA.
