Riduci la latenza degli LLM con il routing basato sul prefisso su Amazon SageMaker Inference.
· By Antonio Sedino, CTRO · Published by Reinventy Solutions Corp.
Amazon SageMaker Inference introduce il routing consapevole del prefisso per mantenere calda la cache KV per i prefissi di prompt condivisi.
Amazon SageMaker Inference introduce il routing consapevole del prefisso per mantenere calda la cache KV per le richieste che condividono lo stesso prefisso di prompt.
