Implementazione di Qwen3.8-2.4T-A95B su Amazon SageMaker HyperPod con vLLM
· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.
La procedura dettagliata copre il provisioning del cluster, la quantizzazione NVFP4, un endpoint compatibile con OpenAI dotato di ragionamento, chiamata di strumenti e decodifica speculativa.
Il blog AWS Machine Learning spiega come distribuire il modello open-weight Qwen3.8-2.4T-A95B da 2.4 bilioni di parametri su Amazon SageMaker HyperPod utilizzando vLLM. La guida copre il provisioning del cluster, la quantizzazione NVFP4 e la configurazione di un endpoint compatibile con OpenAI con ragionamento integrato, chiamata di strumenti e decodifica speculativa MTP nativa.
