Reinventy Solutions Corp. · Technology intelligencePrivate control
ReinventyHERALD
Evidence-led daily edition
← Front pageArtificial Intelligence

Réduisez la latence des LLM avec le routage tenant compte des préfixes sur Amazon SageMaker Inference

· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.

Amazon SageMaker Inference introduit le routage conscient des préfixes pour maintenir le cache KV chaud pour les préfixes d'invite partagés.

Amazon SageMaker Inference introduit le routage conscient du préfixe pour maintenir le cache KV chaud pour les requêtes partageant le même préfixe d'invite.

Read the original source at AWS Machine Learning Blog ↗