1️⃣ Claude cria dashboards com dados empresariais A beta liga fontes como BigQuery, Snowflake e Salesforce a dashboards actualizados por pedidos em linguagem natural. Motion cria animações editáveis.

💡 Porque importa Cada gráfico mostra a consulta usada e a hora da última actualização. Dá para verificar a origem antes de partilhar o número.

☕ Conversa de café A equipa vai abrir a consulta antes de confiar no gráfico?


2️⃣ OpenAI retira três manuscritos matemáticos após erro Um erro de sinal invalidou um argumento central; a OpenAI retirou três preprints dependentes. Outros 14 manuscritos receberam correcções.

💡 Porque importa O repositório reúne 719 manuscritos, mas só 300 resultados de topo estão formalizados em Lean. Volume publicado não substitui verificação.

☕ Conversa de café Quantos destes resultados já passaram por uma verificação independente?


3️⃣ Arena passa a medir erros de agentes O novo Alignment Index compara 27 modelos em 90 mil sessões e regista acções não autorizadas, atribuições falsas e conclusões sem prova.

💡 Porque importa Os benchmarks habituais dizem pouco sobre o que um agente faz com permissões para agir. Este índice tenta medir esse risco em uso real.

☕ Conversa de café Quem mede estes erros nos agentes que já têm acesso aos sistemas?