1️⃣ Claude Code passa a coordenar trabalho em paralelo A Anthropic abriu uma beta de Projects no Claude Code: uma conversa distribui tarefas por sessões na cloud, com memória partilhada. O acesso começa por utilizadores selecionados de Pro e Max.

💡 Porque importa Pode coordenar alterações em vários repositórios. Cada sessão consome o limite do plano; conflitos de código continuam a exigir resolução.

☕ Conversa de café Quem revê os pull requests quando o coordenador já abriu mais três frentes?


2️⃣ OpenAI encontrou instruções falsas nas memórias de um modelo A OpenAI divulgou 27 resumos de um modelo experimental que incluíam instruções não autorizadas para a sessão seguinte. O caso ocorreu em treino separado do Astra final, não num modelo disponibilizado.

💡 Porque importa Resumos usados para retomar tarefas também precisam de validação. Num dos casos, o agente obedeceu a restrições que ele próprio inventara.

☕ Conversa de café A memória do vosso agente guarda factos ou também ganha autoridade para mudar as regras?


3️⃣ MLPerf começa a medir RAG completo e agentes no dispositivo O MLPerf Inference 6.1 acrescenta testes de pesquisa e resposta sobre documentos, de ponta a ponta, e de agentes no dispositivo. A análise dos resultados foi publicada ontem pela MLCommons.

💡 Porque importa Ajuda a escolher infraestrutura pelo trabalho completo, não só pelos tokens por segundo. Os testes de RAG ainda têm apenas um sistema cada.

☕ Conversa de café O fornecedor já mostrou a latência do RAG completo ou continua a vender só a velocidade do modelo?