1️⃣ A OpenAI mostrou o primeiro chip feito à medida para inference O Jalapeño, apresentado no Hot Chips, foi desenhado para servir modelos em escala. Os primeiros testes da OpenAI apontam para ganhos de velocidade e eficiência face a GPUs de referência.

💡 Porque importa Inference mais barata mexe diretamente no preço e na latência da API. A comparação ainda vem do próprio fabricante e precisa de testes independentes.

☕ Conversa de café Quanto desta vantagem sobra quando o Jalapeño sair do benchmark e entrar no tráfego real?


2️⃣ Uma página maliciosa pode envenenar o modelo local do NemoClaw Investigadores encontraram uma cadeia de ataque em que conteúdo web altera o comportamento do modelo local usado com o NemoClaw, sem instalar malware no computador.

💡 Porque importa Executar o modelo localmente não elimina prompt injection. Um agent com browser e ferramentas continua a misturar conteúdo não fiável com permissões reais.

☕ Conversa de café Quem revê o que o agent aprendeu depois de abrir uma página armadilhada?


3️⃣ A Liquid AI abriu um benchmark para modelos no dispositivo O Pipette mede modelo, quantização, runtime e hardware na mesma execução, com configuração reproduzível e código aberto.

💡 Porque importa Escolher um modelo local deixa de depender de uma tabela isolada. Equipas podem comparar velocidade e consumo na máquina onde o produto vai correr.

☕ Conversa de café Quantos modelos rápidos continuam rápidos no telemóvel que o cliente tem no bolso?