NVIDIA anuncia programação de GPU em Rust com CUDA
A NVIDIA anunciou caminhos para escrever kernels de GPU em Rust com CUDA. Entenda o que muda, como a integração funciona e quando essa opção faz sentido para seus projetos.
A NVIDIA anunciou caminhos para escrever kernels de GPU em Rust com CUDA. Entenda o que muda, como a integração funciona e quando essa opção faz sentido para seus projetos.
A versão 0.28.0 do vLLM reúne melhorias em cache, batching, decodificação especulativa, quantização e APIs. Veja como a ferramenta funciona, como testar localmente e em quais cenários ela faz sentido para um projeto brasileiro.
Patches do kernel e utilitários de espaço de usuário estão mudando a forma como o Linux lida com a falta de vRAM. Entenda o papel do DMEM, do GTT e das ferramentas que priorizam o jogo em primeiro plano.
Um relato de competição mostra como um loop de experimentos guiado por IA levou um kernel de QR em GPU de cerca de 419.000 para 1.805 microssegundos. Entenda o método, o papel do Triton e o que vale copiar para seus próprios benchmarks.
Descubra como o AirLLM permite rodar modelos gigantes como Llama 3 70B em placas de vídeo populares de 4GB sem estourar a VRAM.
A Spectral Compute esta tentando fazer CUDA rodar em GPUs de outras fabricantes, sem precisar de hardware Nvidia. Entenda o projeto SCALE, como funciona e o que significa para devs de IA e computação de alto desempenho.
Nvidia vende GPUs para CoreWeave e Nebius, que oferecem infraestrutura de IA, e Nvidia reinveste nos provedores. Entenda o ciclo financeiro por trás do boom de hardware de IA.
GPU, latência, custo por request, versionamento e fallback. Colocar um modelo de IA pra rodar de verdade tem detalhes que a maioria só descobre na prática.
Treinar modelo de IA com uma GPU e como fazer mudança com uma colher de cha. Entenda como funcionam os clusters de GPU, por que são tao caros e quando realmente fazem sentido para o seu projeto.