Google cria algoritmo que reduz em 6 vezes consumo de memória em IA
O Google Research apresentou o TurboQuant, um algoritmo de compressão para grandes modelos de linguagem. O sistema reduz o consumo de memória e acelera o processamento sem comprometer a precisão dos resultados.
A divisão de pesquisa da Big Tech criou uma técnica de compressão aplicada ao cache de chave-valor em modelos de IA generativa. Esse cache armazena dados importantes para evitar recálculos repetidos. Os grandes modelos de linguagem processam informações por meio de vetores que mapeiam o significado semântico de textos tokenizados.
Vetores de alta dimensão descrevem informações complexas como pixels de imagens ou grandes conjuntos de dados. Esses vetores consomem grande quantidade de memória e ampliam o cache de chave-valor. Desenvolvedores utilizam técnicas de quantização para executar modelos com menor precisão, mas isso degrada a qualidade das saídas.
A demanda crescente por memória dos modelos de IA generativa motivou o desenvolvimento do TurboQuant, já que adquirir memória RAM sem pagar preços elevados é quase impossível devido à alta demanda desses sistemas. Os métodos tradicionais de compressão impactam negativamente na qualidade dos resultados.
Resultados dos testes
Os resultados iniciais do Google indicam aumento de desempenho de oito vezes em alguns testes. De acordo com a informações, a redução no uso de memória alcançou seis vezes em determinados testes. O TurboQuant diminuiu o uso de memória no cache de chave-valor em seis vezes em todos os testes realizados.
O algoritmo quantiza o cache para apenas três bits sem treinamento adicional. O cálculo da pontuação de atenção com TurboQuant de quatro bits é oito vezes mais rápido comparado com chaves não quantizadas de 32 bits em aceleradores Nvidia H100.
O Google testou a compressão algorítmica em um conjunto de benchmarks de contexto longo usando modelos abertos Gemma e Mistral. Conforme as informações disponíveis, o TurboQuant teve resultados downstream perfeitos em todos os testes. O algoritmo pode trabalhar juntamente com modelos existentes.
Funcionamento do sistema
A aplicação do TurboQuant a um modelo de IA envolve duas etapas. O Google desenvolveu um sistema chamado PolarQuant para alcançar compressão de alta qualidade. Os vetores em modelos de IA são codificados usando coordenadas XYZ padrão. O PolarQuant converte vetores em coordenadas polares em um sistema cartesiano.
Nessa grade circular, os vetores ficam reduzidos a duas informações: um raio e uma direção. O raio representa a força dos dados principais, enquannto a direção representa o significado dos dados.
O Google oferece uma analogia do mundo real para explicar esse processo: as coordenadas vetoriais são como direções. A codificação tradicional seria “vá três quarteirões para o leste, quatro quarteirões para o norte”, mas usando coordenadas cartesianas, ficaria simplesmente “vá cinco quarteirões a 37 graus”. Isso ocupa menos espaço e evita executar etapas caras de normalização de dados.
Aplicações futuras
O TurboQuant poderá tornar os modelos de IA menos caros para operar. As empresas que criam essa tecnologia poderão usar a memória liberada para executar modelos mais complexos.
A IA móvel poderá ter mais benefícios com essa tecnologia. Com as limitações de hardware de um smartphone, por exemplo, técnicas de compressão como o TurboQuant poderiam melhorar a qualidade das saídas sem enviar dados do usuário para a nuvem.
