Costruisci una fabbrica di modelli Physical AI con NVIDIA Cosmos 3 su SageMaker HyperPod
· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.
Creare un sistema Physical AI richiede una pipeline continua, non un singolo job di training. Questo post mostra come eseguire quella factory di modelli (generazione di dati sintetici, post-training e valutazione chiusa con NVIDIA Cosmos 3) su un cluster persistente e resiliente Amazon SageMaker HyperPod su Amazon EKS, con GPU goodput come
Creare un sistema Physical AI richiede una pipeline continua, non un singolo job di training. Questo post mostra come eseguire quella factory di modelli (generazione di dati sintetici, post-training e valutazione chiusa con NVIDIA Cosmos 3) su un cluster persistente e resiliente Amazon SageMaker HyperPod su Amazon EKS, con GPU goodput come. Il flusso di lavoro include la generazione di dati sintetici per aumentare la varietà degli scenari, fasi di post-training per affinare le prestazioni e una valutazione chiusa per garantire la sicurezza prima del deployment. AWS SageMaker HyperPod mantiene la posizione dei cluster per addestramenti lunghi, mentre Amazon EKS coordina l'orchestrazione dei container. Le organizzazioni possono costruire centri di addestramento AI resilienti che riducono i tempi di inattività e massimizzano la goodput delle GPU. Il post è stato scritto da ricercatori di NVIDIA e AWS.
