O tráfego de busca por “IA no hospital” é vendido com demo. Em 19 de agosto de 2026, a Nature Medicine publicou o irmão honesto dessa demo: uma avaliação prospectiva DECIDE-AI estágio 1 do SHAKED, sistema de apoio à decisão clínica baseado em vários modelos de linguagem, no pronto-socorro do Rambam Health Care Campus em Haifa, com coautores do Technion. O número de acerto não é a linha que os autores colocam na frente. O uso caiu.
O que aconteceu
Em quatro semanas a equipe analisou 1.138 pacientes em duas unidades paralelas: uma com SHAKED, outra em rotina. ClinicalTrials.gov: NCT06902675. Autor correspondente Shahar Shelly, neurologia do Rambam e faculty do Technion. Primeiros autores em igualdade Liron Leibovitch e Adi Ahituv. Recebido em 1º de março de 2026; aceito em 22 de julho de 2026; publicado em 19 de agosto de 2026. DOI 10.1038/s41591-026-04601-5.
O SHAKED não é um único modelo de fundação com uma janela de chat colada. Os dados estendidos descrevem um pipeline dirigido a eventos a partir do EHR: um event server e um scheduler puxam um histórico estruturado, um módulo de geração aumentada por recuperação fica atrás de uma interface de chat do clínico, e a inferência rodou no AWS Bedrock. O financiamento foi apoio AWS Partner mais US$ 20 mil em créditos de nuvem. O financiador não teve papel no desenho nem na análise. Os autores declaram não ter interesses concorrentes.
| Medida | Resultado | Fonte |
|---|---|---|
| Pacientes | 1.138 em 4 semanas, duas alas paralelas | resumo |
| Revisão de especialistas das saídas amostradas | 99 de 100 clinicamente adequadas | resumo |
| Eventos adversos | nenhum detectado | resumo |
| Tempo de permanência no PS | 4,9 horas nas duas alas, P = 0,99 | resumo |
| Ciclo de consulta (ITT) | −9,4 minutos, P = 0,077 (não significativo) | resumo |
| Adoção clínica | 68% → 30% | resumo |
| Desengajamento por carga | OR = 0,72 por hora de plantão (IC 95% 0,62–0,83) | resumo |
| Preferência para consultas de radiologia | OR = 2,98 (IC 95% 1,58–5,63) | resumo |
A atribuição de ala não foi um cluster randomizado no sentido que sustentaria afirmações causais sobre tempo de permanência. Um modelo de propensity score para atribuição de ala teve AUC 0,543 (n = 1.133) — perto do acaso — que é o que se quer se as alas eram parecidas. Depois de ponderação por probabilidade inversa, as diferenças padronizadas de média caíram para dentro de ±0,10 (máximo 0,032). Estimativas per-protocol do tempo de consulta estão marcadas nos dados estendidos como possivelmente enviesadas por adoção seletiva. A última linha do artigo é a trava editorial: os achados informam o desenho de um ensaio randomizado e “não justificam o uso clínico de apoio à decisão por IA neste estágio.”
O código de análise é público (MIT) em github.com/llironlibo/SHAKED-analysis e Zenodo 10.5281/zenodo.20736931. Dados em nível de paciente são de acesso controlado sob a lei israelense de privacidade em saúde e o IRB do Rambam.
Por que importa
A maior parte da cobertura de IA hospitalar ainda trata o modelo como o gargalo. Este paper mediu o gargalo como se o clínico cansado ainda abre a ferramenta na oitava hora. A adoção caiu de 68 por cento para 30 por cento, e a odds ratio por hora de plantão é 0,72. Consultas de radiologia foram o caso de uso que os médicos preferiram. O tempo de permanência não se moveu. A tendência do ciclo de consulta não passou de P = 0,05 na intenção de tratar.
Essa combinação é a versão Good Signal de uma história de IA: hospital nomeado, protocolo registrado, número que passou por revisão, e um limite que os próprios autores escreveram. É o irmão honesto do ensaio LiON de CT de fígado publicado no mesmo dia no mesmo periódico. O LiON mudou 37 laudos como leitor extra numa fila de CT. O SHAKED pediu a médicos de emergência que continuassem engajando uma interface de chat sob carga. Um se implantou como segundo par de olhos em imagens; o outro pediu um clique num box lotado. As curvas de engajamento são a notícia.
DECIDE-AI é um guia de relato para avaliação clínica inicial de apoio à decisão por IA (Nat Med 2022). Chamar isto de estágio 1 é disciplina, não hedge. Nenhum evento adverso em quatro semanas não é um dossiê de segurança de longo prazo. Noventa e nove de 100 saídas amostradas não é a afirmação de que a corrida de 1.138 pacientes foi livre de erro. É uma amostra.
O que observar a seguir
- Um ensaio randomizado que trate engajamento como desfecho primário, não como nota de rodapé. Até lá, o fato verificado é 99/100 saídas adequadas, tempo de permanência igual, e uso caindo de 68% para 30%.
- Desenho por hora de plantão. Se o OR de 0,72 for real, uma ferramenta que só funciona na primeira hora não é ferramenta de PS. Observe se o próximo protocolo randomiza no plantão ou na ala.
- Não implante a partir deste paper. Os autores já escreveram essa frase. Cite-a.
Fontes
- Leibovitch, L. et al. Nat Med (2026). https://doi.org/10.1038/s41591-026-04601-5
- ClinicalTrials.gov NCT06902675 — https://clinicaltrials.gov/study/NCT06902675
- Código de análise — https://github.com/llironlibo/SHAKED-analysis e https://doi.org/10.5281/zenodo.20736931


