Pare de adicionar mais GPUs: a nova plataforma de armazenamento da Weka reduz a carga armazenando em cache 100% dos tokens pré-calculados de um modelo de IA

Pare de adicionar mais GPUs: a nova plataforma de armazenamento da Weka reduz a carga armazenando em cache 100% dos tokens pré-calculados de um modelo de IA

A memória da GPU é o recurso mais caro na IA de produção e também o que se esgota mais rápido.

Longas janelas de contexto e conversas múltiplas forçam os modelos de IA a recalcular repetidamente as informações que já processaram, consumindo memória da GPU e computação que, de outra forma, poderia servir a usuários adicionais ou gerar novas respostas.

Em vez de tratar a memória da GPU como um recurso limitante, por que não estendê-la com tecnologias de armazenamento muito mais baratas?

Weka, por exemplo, acredita que o armazenamento flash barato pode preencher essa lacuna. A plataforma de software NeuralMesh 6 da empresa, lançada junto com sua primeira linha de hardware autoprojetada, Wekapod 3, estende o que Weka chama de Augmented Memory Grid, uma abordagem que agrega flash NAND para se comportar como memória GPU por uma fração do custo.

Esta é uma categoria ativa e cada vez mais concorrida. Dell, NetApp, Pure Storage e VAST se reposicionaram em direção à infraestrutura de IA nos últimos dois anos e Weka é um dos vários fornecedores que argumentam que ela foi construída para este momento específico, em vez de se adaptar a ele.

"O que estamos vendo agora com os clientes é que eles estão em busca de disponibilidade de computação e, quando conseguem uma nova alocação de alguém, querem poder agarrá-la e começar a trabalhar imediatamente." O cofundador e CEO da Weka, Liran Zvibel, disse ao VentureBeat.

A recompensa potencial é simples: melhor utilização dos investimentos existentes em GPU, custos de inferência mais baixos e implantação mais rápida de novas cargas de trabalho de IA sem esperar meses por capacidade adicional de GPU.

A tecnologia é mais relevante para organizações que já operam IA em escala ou que esperam um rápido crescimento no uso, especialmente empresas que criam copilotos internos, agentes de atendimento ao cliente, assistentes de engenharia de software ou sistemas de recuperação com longas janelas de contexto. Implantações menores podem ter benefícios menos imediatos do que organizações onde a utilização da GPU já se tornou um fator limitante.

Por dentro do NeuralMesh 6 da Weka

O NeuralMesh 6 adiciona quatro recursos voltados diretamente para uma lacuna de funcionalidade que Zvibel diz que tem custado negócios à Weka em avaliações competitivas.

Multilocação combinável e virtual. Os clusters combináveis ​​oferecem aos locatários âncora isolamento total em nível de hardware, CPU, memória e armazenamento dedicados. A multilocação virtual é executada por meio da estrutura RDMA da Weka, oferecendo isolamento em nível de rede que ultrapassa 1.000 locatários por cluster, com provisionamento em menos de 30 minutos. Combinado, um único cluster executando 50 clusters combináveis ​​pode suportar até 50.000 locatários.

Armazenamento unificado de arquivos e objetos. A maioria dos sistemas de armazenamento mantém dois caminhos separados: um caminho baseado em arquivo (a forma padrão como servidores e aplicativos leem e gravam arquivos, muito usado em treinamento e ajuste de pipelines) e um caminho baseado em objeto (S3, a inferência de formato e as ferramentas nativas da nuvem normalmente esperam). Normalmente, um gateway faz a conversão entre os dois, o que significa que os dados existem efetivamente duas vezes. A afirmação de Weka é que os mesmos dados físicos no disco podem ser lidos diretamente por qualquer caminho ao mesmo tempo, sem camada de tradução, sem segunda cópia. Zvibel tem como alvo especificamente nuvens de GPU não AWS, nomeando Lambda, Nebius, G42 e CoreWeave, com o que ele descreveu como desempenho aproximadamente duas ordens de magnitude superior ao S3 convencional e um modelo de preços baseado em capacidade em vez de cobranças por API.

Replicação que prioriza metadados. Os ambientes de destino tornam-se navegáveis ​​antes da chegada de uma cópia completa dos dados, com a hidratação dos dados somente quando acessados.

"Eles tiveram que esperar que tudo isso chegasse ao outro lado, e isso leva dias ou semanas, em casos extremos, um mês," Zvibel disse. "Agora permitimos que nossos clientes obtenham alguma alocação de novas GPUs e comecem a trabalhar em uma hora."

Redução de dados AlloyFlash e Always-On. TLC e QLC são dois tipos de memória flash NAND. O TLC é mais rápido e durável, mas custa mais por terabyte, enquanto o QLC é mais barato e armazena mais dados por chip, mas é mais lento. O AlloyFlash combina ambos em um único cluster, roteando automaticamente o trabalho sensível à latência para o TLC enquanto executa cargas de trabalho de grande capacidade no QLC, reduzindo o custo por terabyte sem prejudicar o desempenho do trabalho que precisa de velocidade. A redução de dados agora é executada por padrão e não como uma opção.

Resolvendo o problema de contexto da IA

A multilocação e o armazenamento de objetos resolvem como as empresas e as neonuvens operam a plataforma no dia a dia. Um problema mais difícil está subjacente: à medida que as janelas de contexto e as interações multivoltas crescem, também aumenta o desperdício de computação da GPU no recálculo do trabalho que um modelo já realizou. Augmented Memory Grid, um recurso do NeuralMesh 6 desenvolvido especificamente para isso, é a resposta de Weka.

Cada prompt aciona dois estágios. O Prefill calcula a atenção, o mecanismo central por trás de como grandes modelos de linguagem processam a entrada, e é computacionalmente caro. Decode converte esse cálculo em saída e é comparativamente leve.

O custo é mais difícil em sessões de vários turnos, como bate-papo ou codificação, onde cada novo turno aciona novamente o pré-preenchimento para tudo o que veio antes, a menos que o trabalho tenha sido armazenado em cache.

"Se você tiver 10 turnos, poderá calcular demais 100 vezes porque estará refazendo todos eles. Se você tiver 20, calculará a mais 400 vezes," Zvibel disse. "Você pode colocar duas ordens de magnitude a mais de NAND do que poderia pagar na memória compartilhada, e podemos armazenar em cache 100% dos tokens pré-calculados, para que você nunca precise refazê-lo."

Onde Weka se posiciona competitivamente

Os fornecedores de armazenamento passaram o último ano e meio reposicionando-se em torno da IA, e separar a capacidade genuína das mensagens reposicionadas é agora um verdadeiro problema de avaliação para os compradores.

"O mundo do armazenamento está mudando seu foco do fornecimento de bits para cargas de trabalho empresariais para o gerenciamento de dados na velocidade da IA. Vimos isso com mais clareza nos últimos 18 meses na Dell, NetApp e Pure," Steve McDowell, analista-chefe da NAND Research, disse ao VentureBeat. "O interessante é que empresas como Weka e VAST são as verdadeiras empresas de dados nativas de IA, resolvendo esses problemas desde o primeiro dia."

McDowell destacou Augmented Memory Grid como o líder técnico mais claro de Weka.

"Weka continua a ter a implementação de cache KV com maior capacidade técnica do mercado com sua Grade de Memória Aumentada," ele disse. " Eles chegaram cedo com essa tecnologia e continuam a inovar. Isto é fundamental para a inferência de IA, pois permite um nível de eficiência de GPU que, sem dúvida, economiza dinheiro em GPUs e memória. Essa é a chave para o mercado atual com restrição de memória e GPU."

Ele também sinalizou a garantia contratual da Weka sobre suas reivindicações de redução de dados como subestimada.

"Um voo um pouco fora do radar: Weka está colocando seu dinheiro onde está sua boca com suas garantias contratuais para suas promessas de redução de dados," ele disse.

O conselho de McDowell aos compradores que avaliam reivindicações concorrentes de Weka, VAST, Pure e NetApp foi apontado sugerindo que os compradores corporativos deveriam analisar atentamente o que os fornecedores estão prometendo versus o que eles realmente estão entregando.

"Um comprador inteligente observará como os fornecedores concorrentes estão resolvendo problemas do mundo real hoje," McDowell disse. " Eles fazem isso conversando com organizações que executam cargas de trabalho semelhantes em escala semelhante. Se um fornecedor não puder apontar isso, então deverá ser um sinal de alerta."



Fonte ==> Cyberseo

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *