Capítulo 10 de la serie Sprint DGX. Lo que construimos en 60 días con NVIDIA Innovation Lab, y por qué decidimos que viviera en la clínica, no en la nube.
La boca es uno de los mejores sitios del cuerpo para darse cuenta a tiempo de cosas que importan. Una lesión que cambia, un patrón que no encaja, un detalle que conviene mirar dos veces. El cuello de botella casi nunca es la falta de información, una clínica genera radiografías, historiales y notas cada día, sino la falta de un par de ojos extra, incansables y consistentes, que ayuden al profesional a no pasar nada por alto.
Eso es lo que construimos en QuantumHowl. Y este último trimestre dimos el salto más grande hasta la fecha: entrenamos el cerebro de visión de nuestro producto dental sobre un nodo de ocho GPUs NVIDIA H100, gracias a un grant de 60 días del programa NVIDIA Innovation Lab.

En un examen público de conocimiento dental, nuestro modelo especializado queda por delante de modelos generalistas mucho más grandes y caros.
Qué construimos
Un modelo de visión y lenguaje especializado en odontología, partiendo de Gemma 4 31B, uno de los modelos abiertos más capaces de su tamaño, y afinándolo con datos clínicos propios. No es un chatbot al que le pegas una foto: es un modelo que mira la imagen y razona sobre ella en el mismo paso.
La primera decisión seria fue elegir bien la base. Antes de invertir un solo día de entrenamiento, comparamos candidatos sobre preguntas clínicas dentales reales. Gemma 4 superó a la alternativa con la que habíamos arrancado por más de 25 puntos porcentuales, con significancia estadística. Cambiar de caballo a tiempo, con datos en la mano, nos ahorró el sprint entero.
Qué sabe hacer
- Ve la radiografía. Panorámicas, periapicales, fotografías intraorales. El modelo interpreta la imagen directamente, no una descripción de la imagen hecha por otro sistema.
- Razona en español y en inglés, por igual. Lo verificamos con pruebas propias diseñadas para ello: la calidad en castellano no es un «modo traducción» de segunda, es paridad real. Para un mercado clínico hispanohablante, eso no es un detalle.
- Mejora medible. Tras la especialización, el modelo gana +6,72 puntos porcentuales en inglés y +7,13 en español en un examen público de conocimiento dental (MMOral-Bench), un resultado muy competitivo en su categoría de tamaño.
- Responde en tiempo real. Lo bastante rápido para acompañar al profesional durante la consulta, no para hacerle esperar.
Por qué decidimos que viviera en la clínica, no en la nube
Esta es, para nosotros, la parte que de verdad diferencia el producto. El modelo está pensado y validado para correr on-premise, dentro de la clínica, sobre una NVIDIA DGX Spark, el ordenador de IA de sobremesa de NVIDIA, con 128 GB de memoria unificada, como configuración mínima, y de ahí hacia arriba. ¿Qué significa eso en la práctica?
Que ni una sola imagen del paciente sale del edificio. No hay datos sanitarios viajando a un servidor de terceros, no hay dependencia de una conexión, no hay un proveedor de nube en medio de la conversación entre el dentista y su información. En un sector donde el dato es especialmente sensible, y la normativa, especialmente exigente, «se queda en casa» no es una concesión técnica: es una ventaja de partida.
No es una demo
El producto en el que se integrará esta capa ya está en producción en una clínica real, atendiendo a varios miles de pacientes y gestionando cientos de miles de imágenes, de forma estable. El sprint no construyó un prototipo para enseñar en un vídeo: entrenó la capa más difícil, la de inteligencia, de un sistema que ya funciona, para que lo que el profesional ya usa cada día sea, sencillamente, mejor.
Hacia dónde va
El objetivo no ha cambiado desde el primer día: poner en manos del profesional una ayuda que vea lo que importa, antes y mejor, sin pedirle que renuncie al control de sus datos ni de su consulta. Lo conseguido en estos 60 días, un modelo que ve, razona en dos idiomas y está diseñado para vivir on-premise, es el cimiento. Lo siguiente es llevarlo a más clínicas.
Si trabajas en un grupo dental, inviertes en salud digital, o simplemente te interesa cómo se construye IA clínica que respeta de verdad la privacidad, nos encantará enseñártelo.
¿En qué hardware correrá? El objetivo de despliegue es una NVIDIA DGX Spark, 128 GB de memoria unificada, como mínimo, y cualquier equipo superior. Memoria de sobra para cargar el modelo completo, y el despliegue sobre Spark ya está validado: potencia de clase centro de datos en una caja que cabe en la consulta, no en un data center remoto.
¿Está disponible? El sistema base está en producción. La integración de esta nueva capa de visión avanza por fases; estamos abiertos a conversaciones con clínicas y partners.
Próximo capítulo: por qué «leer una radiografía» no es lo mismo que describirla en texto y razonar sobre esa descripción, y por qué esa diferencia importa.





