Google Research Riduce Memoria LLM Fino a 6x con TurboQuant

Google Research ha pubblicato TurboQuant per comprimere i KV cache dei LLM. Test iniziali mostrano riduzione del KV cache fino a 6x e accelerazione dell'inference fino a 8x senza perdita misurabile di accuratezza. La tecnica combina PolarQuant per la conversione di coordinate e Quantized Johnson-Lindenstrauss per gestire i residui.

Part of the PlainSec briefing for 2026-03-26

Every edition of this story: Google Research Riduce Memoria LLM Fino a 6x con TurboQuant

Sources