Intel acaba de anunciar uma revolução no campo da compressão de modelos de linguagem (LLMs, na sigla em inglês). Pesquisadores da empresa conseguiram reduzir um modelo ternário de 1,58 bit para impressionantes 1,485 bits por peso, sem alterar uma única configuração do modelo. Essa conquista desafia o que era considerado um limite teórico e abre caminho para modelos de IA mais eficientes e rápidos.
O Que Significa 1,58 Bit?
Modelos ternários de linguagem são aqueles que utilizam três valores distintos para representar pesos: -1, 0 e 1. Tradicionalmente, armazenar esses pesos exigia, no mínimo, 1,58 bits por parâmetro, baseado na teoria da informação. Esse número era considerado um limite intransponível. No entanto, a Intel decidiu desafiar essa premissa.
BITCOS: A Solução da Intel para Compressão Avançada
A nova técnica desenvolvida pela Intel é chamada de BITCOS (Binary-Ternary Compression Scheme). Ela explora a distribuição pesada de zeros nos modelos ternários — que podem chegar a 51,5% de zeros — para otimizar o armazenamento. Ao fazer isso, a equipe conseguiu reduzir a quantidade de bits necessários para representar cada peso, alcançando 1,485 bits em alguns casos.
Benefícios e Desempenho
Além da redução significativa no espaço ocupado, o BITCOS também traz melhorias no desempenho. Os testes realizados pela Intel mostram:
- Aceleração de até 27% no processamento em GPUs.
- Aumento de até 18% no desempenho em CPUs.
- Melhoria de até 28% no desempenho de kernels de matrizes vetoriais.
Essas melhorias são alcançadas sem a necessidade de hardware especializado, funcionando em processadores padrão como Intel Xe2 GPUs e CPUs com suporte a AVX-512 e AVX2.
Testes e Validação
Os pesquisadores da Intel testaram o BITCOS em 29 modelos ternários de linguagem publicados. Em 26 deles, o método superou o formato padrão de compactação de cinco trits, alcançando resultados superiores ao limite teórico de 1,585 bits por peso. Esse desempenho é especialmente notável, pois supera até mesmo o formato de 1,625 bits usado atualmente.
Impacto no Futuro da IA
Essa inovação pode ter implicações profundas para a indústria de IA, permitindo que modelos de linguagem sejam executados em dispositivos com recursos limitados, como smartphones e edge devices, sem comprometer a precisão. Além disso, a redução no consumo de energia e no espaço de armazenamento pode tornar a IA mais acessível e escalável.
Com o BITCOS, a Intel não apenas quebrou uma barreira técnica, mas também abriu novas possibilidades para a otimização de modelos de IA, impulsionando a eficiência e o desempenho em aplicações do mundo real.