CarpuleNetRed global de odontología
Software
Patología Oral y MaxilofacialJournal of International Medical Research2025

DEEP LEARNING EN LESIONES QUÍSTICAS Y TUMORES MAXILOFACIALES

Promesa diagnóstica, pero aún no lista para decidir sola

El artículo explica cómo el deep learning se está usando para detectar, clasificar y segmentar lesiones quísticas de los maxilares y tumores maxilofaciales en radiografías panorámicas, CBCT y algunos estudios con CT. Los modelos más mencionados incluyen detectores tipo YOLO/RetinaNet, clasificadores CNN o transformer, U-Net para segmentación, Mask R-CNN y variantes que integran restricciones anatómicas.

DOI: 10.1177/03000605251404778Fuente originalPublicado: 22 de agosto de 2026
Patología Oral y Maxilofacial

DEEP LEARNING EN LESIONES QUÍSTICAS Y TUMORES MAXILOFACIALES

Promesa diagnóstica, pero aún no lista para decidir sola

DETECCIÓNSEGMENTACIÓNCLASIFICACIÓN
01

Respuesta rápida

El artículo explica cómo el deep learning se está usando para detectar, clasificar y segmentar lesiones quísticas de los maxilares y tumores maxilofaciales en radiografías panorámicas, CBCT y algunos estudios con CT. Los modelos más mencionados incluyen detectores tipo YOLO/RetinaNet, clasificadores CNN o transformer, U-Net para segmentación, Mask R-CNN y variantes que integran restricciones anatómicas.

La idea central es prometedora: la IA puede señalar lesiones radiolúcidas, sugerir diagnósticos probables como OKC, quiste dentígero, quiste periapical o ameloblastoma, y delimitar volúmenes para medición o planificación quirúrgica. Sin embargo, el artículo insiste en que muchos resultados altos provienen de estudios pequeños, de un solo centro, con validación limitada, sesgo de selección, clases desbalanceadas, anotaciones variables y riesgo de sobreajuste. Si las etiquetas están equivocadas, son incompletas o vienen de diagnósticos no confirmados, el modelo puede aprender errores con mucha precisión aparente.

En detección, varios modelos tipo YOLO reportaron buen rendimiento técnico en panorámicas. Por ejemplo, se mencionan estudios con precisión alrededor de 0.87 en 1282 panorámicas, o precisión y recall cercanos a 0.95 tras aumento de datos. Pero esos números pertenecen a estudios concretos y no equivalen automáticamente a utilidad clínica real: con frecuencia se reportan métricas por lesión o caja, no resultados por paciente, tiempo ahorrado, carga de falsos positivos o beneficio en decisiones clínicas.

En detección, no basta con saber cuántas lesiones marca la IA; también importa cuántas alertas falsas genera por imagen o por paciente. Una IA con demasiadas alertas puede aumentar la carga de trabajo en vez de reducirla.

En clasificación, algunos estudios específicos reportaron exactitudes superiores al 80-90%, especialmente con transferencia de aprendizaje y aumento de datos. Pero esos valores dependen del dataset, la selección de ROI, el número de clases, la modalidad de imagen, el balance de lesiones y la estrategia de validación. En estudios que mezclan panorámica y CBCT, el rendimiento debe interpretarse con cautela: el modelo puede aprender atajos relacionados con la modalidad, el recorte del ROI o la forma de preparar la imagen, en lugar de rasgos verdaderamente generalizables de la lesión.

La clasificación multiclase es más difícil que decir “lesión sí/no”, porque varias entidades comparten radiolucidez, bordes definidos, festoneado o expansión. Por eso, una salida forzada de una sola etiqueta puede ser peligrosa. La opción “incierto-derivar” debe entenderse como una estrategia prudente propuesta para reducir errores de clasificación forzada, no como una función ya validada clínicamente en todos los modelos revisados.

En segmentación, U-Net, Mask R-CNN y modelos 3D pueden delinear lesiones con Dice alto en algunos estudios. Esto puede ayudar a estimar tamaño, volumen y planificación. Pero una buena máscara no significa automáticamente margen quirúrgico seguro: la cirugía también depende de histología, comportamiento biológico, corticales, dientes, nervios, seno maxilar, tejidos blandos y estrategia reconstructiva.

Para CarpuleNet, el mensaje final es prudente: el deep learning puede convertirse en una ayuda para triage, segunda lectura, estandarización y planificación, pero todavía necesita validación externa, datos multicéntricos, calibración, explicabilidad útil, gobernanza, privacidad, monitoreo posdespliegue y supervisión clínica.

02

Conocimientos previos para comprender el artículo

1. ¿Por qué estas lesiones son difíciles de diagnosticar por imagen?

Quistes odontogénicos, OKC, quistes dentígeros, quistes periapicales, ameloblastomas y otros tumores pueden verse como radiolucideces similares. En una panorámica, la superposición anatómica y la distorsión pueden ocultar límites o crear apariencias engañosas. En CBCT se ve mejor la extensión tridimensional, pero muchas lesiones siguen requiriendo correlación clínica e histopatológica.

2. ¿Qué significa detección, clasificación y segmentación?

Detección significa localizar una lesión o marcar una caja alrededor de ella. Clasificación significa sugerir qué tipo de lesión podría ser. Segmentación significa dibujar el contorno exacto o máscara de la lesión, píxel por píxel o voxel por voxel. Estas tareas pueden combinarse, pero no siempre forman un flujo obligatorio: algunos modelos solo detectan, otros solo clasifican y otros segmentan; cada uno debe validarse para su uso específico.

3. ¿Por qué una métrica alta no siempre significa utilidad clínica?

Un modelo puede tener alta precisión en un conjunto de prueba controlado y fallar en otro hospital, otro equipo, otra población o imágenes con artefactos. Además, una métrica por caja o por corte no dice si se redujeron errores clínicos, si se ahorró tiempo, si el odontólogo cambió correctamente el plan o si se evitó una cirugía inadecuada.

4. ¿Por qué la histopatología sigue siendo importante?

La IA interpreta patrones de imagen, no tejido microscópico. Puede sugerir que una lesión parece OKC o ameloblastoma, pero no confirma por sí sola la biología. En lesiones que requieren intervención, la confirmación histopatológica sigue siendo esencial para diferenciar entidades con manejo y pronóstico distintos.

03

Ahora sí, pasemos directamente a lo que dice el artículo

¿Qué quiso investigar la revisión?

Los autores buscaron sintetizar aplicaciones recientes de deep learning para diagnóstico por imagen de lesiones quísticas de los maxilares y tumores maxilofaciales. Se centraron en tres tareas: detección/localización, clasificación diagnóstica y segmentación. Además, revisaron limitaciones metodológicas, sesgos, generalización, explicabilidad, privacidad, implementación clínica y direcciones futuras.

¿Cómo se realizó?

La revisión siguió la escala SANRA para revisiones narrativas. Se realizaron búsquedas en PubMed y Scopus desde enero de 2015 hasta agosto de 2025 con términos relacionados con mandíbula/maxilofacial, quistes/tumores/lesiones, panorámica/CBCT y deep learning/CNN/transformers/segmentación/detección/clasificación. Se incluyeron estudios que aplicaran deep learning a panorámica, CBCT o, en algunos casos, CT para lesiones o tumores de los maxilares; se excluyeron estudios no imagenológicos, metodológicos puros y trabajos sin deep learning.

Los autores extrajeron modalidad de imagen, tarea, arquitectura, tamaño de dataset, estrategia de validación —incluida validación externa cuando estaba disponible— y métricas de rendimiento. La revisión destaca 12 estudios representativos de deep learning en tareas de imagen de los maxilares; varios contribuyen a más de una tarea, por ejemplo detección + clasificación o detección + segmentación. Al ser revisión narrativa, este número no debe leerse como recuento sistemático exhaustivo de toda la literatura.

ElementoDato del artículoInterpretación CarpuleNet
DiseñoRevisión narrativa siguiendo SANRA.Útil para panorama crítico; no equivale a revisión sistemática/metaanálisis.
BúsquedaPubMed y Scopus, enero 2015-agosto 2025.Cubre literatura reciente, pero no todas las bases posibles.
TemaDL en PR/CBCT y algunos estudios CT para lesiones de los maxilares y tumores maxilofaciales.Enfoque de imagen odontológica y maxilofacial.
TareasDetección, clasificación y segmentación.Cada tarea tiene métricas y utilidad clínica distinta.
Estudios destacados12 estudios representativos; algunos con más de una tarea.No es recuento sistemático exhaustivo de toda la literatura.
ConclusiónPotencial alto, pero falta validación externa y gobernanza.La IA debe apoyar, no reemplazar juicio clínico.
04

Resultados principales explicados

1. Detección: la IA puede señalar lesiones, pero falta demostrar valor clínico real

Los detectores de una etapa como YOLO y RetinaNet han mostrado rendimiento alto para localizar radiolucideces en panorámicas. Su ventaja es la rapidez: pueden revisar muchas imágenes en poco tiempo y marcar zonas sospechosas. Esto puede servir para triage o segunda lectura.

Pero el artículo advierte que muchos estudios son de un solo centro, usan métricas por lesión o caja, y no siempre reportan sensibilidad/especificidad por paciente, calibración, análisis de beneficio clínico, carga de falsos positivos o validación externa. Por eso, un alto AP o precisión técnica no significa que el modelo ya esté listo para la clínica.

2. Clasificación: diferenciar OKC, quistes y ameloblastoma sigue siendo difícil

La clasificación diagnóstica intenta responder qué lesión es. Modelos como VGG-16, Inception-v3, MobileNet, ResNet o híbridos han sido usados para diferenciar ameloblastomas, OKC, quistes dentígeros y quistes periapicales. Transfer learning y data augmentation pueden elevar el rendimiento en datasets pequeños, pero también pueden ocultar limitaciones si el dataset está sesgado.

Sin embargo, la clasificación multiclase es más exigente que la detección binaria. Muchas lesiones comparten rasgos radiográficos y el costo clínico de equivocarse no es igual: no es lo mismo confundir una lesión inflamatoria simple que subestimar un OKC o un ameloblastoma. Por eso, la revisión recomienda métricas más completas, matrices de confusión, F1 macro/micro, kappa, calibración y estrategias de incertidumbre.

3. Segmentación: útil para volumen y planificación, pero aún limitada

La segmentación delimita tamaño, forma y volumen. U-Net, Mask R-CNN y modelos 3D han mostrado resultados prometedores. La revisión menciona ejemplos con Dice alto para ameloblastomas o lesiones óseas maxilofaciales, incluyendo estudios con CT y CBCT.

Pero la revisión advierte que Dice puede ocultar errores de borde importantes para cirugía. Por eso sugiere reportar HD95, error relativo de volumen y consistencia 3D. Además, faltan estudios que conecten la calidad de la segmentación con decisiones reales, ventanas quirúrgicas, recurrencia o planificación más segura.

4. Los sesgos y la falta de validación externa son el cuello de botella

Las principales fuentes de sesgo son datos de un solo centro, equipos distintos, parámetros de adquisición variables, clases desbalanceadas, anotaciones inconsistentes, ROI preseleccionados y datasets pequeños. Muchos modelos funcionan bien en su propio conjunto de prueba, pero no se sabe si funcionarían igual en otro hospital, otro país, otro equipo CBCT o pacientes con artefactos metálicos.

5. Explicabilidad, privacidad y gobernanza definen la implementación

La IA no debe entregar solo una etiqueta sin explicación. Herramientas como Grad-CAM pueden mostrar qué región influyó en la decisión, pero no explican con razonamiento radiológico completo. Grad-CAM puede mostrar que el modelo miró la zona de la lesión, pero no explica si decidió por festoneado, expansión, adelgazamiento cortical, relación con dientes, densidad interna o margen radiográfico.

Además, el uso de imágenes requiere privacidad y regulación. El artículo propone federated learning, calibración, umbrales sensibles al costo, opción “incierto-derivar” y monitoreo posdespliegue. Estas son estrategias de implementación y mejora, no pruebas de que todos los modelos actuales ya funcionen de forma segura en clínica.

Tarea IAQué puede aportarLímite principal
DetecciónMarcar lesiones sospechosas en PR/CBCT y priorizar revisión.Métricas técnicas no siempre demuestran beneficio clínico.
ClasificaciónSugerir diagnóstico probable: OKC, quiste, ameloblastoma u otros.Lesiones se parecen; necesita calibración e incertidumbre.
SegmentaciónMedir tamaño/volumen y apoyar planificación quirúrgica.Dice alto puede ocultar errores de borde o volumen.
ExplicabilidadHeatmaps pueden mostrar zonas usadas por el modelo.No explican rasgos radiológicos concretos como un especialista.
Federated learningEntrenar con datos multicéntricos sin compartir imágenes.Requiere coordinación, regulación y monitoreo complejo.
Radiomics + DLCombinar rasgos cuantitativos y aprendizaje profundo.Evidencia aún inmadura para uso clínico rutinario.
05

Interpretación clínica de las figuras y tablas

La Figura 1, en la página 6, ilustra el proceso de entrenamiento de un modelo de deep learning para reconocer lesiones quísticas mandibulares. Muestra datos originales, marcación del rango de la lesión, generación de datos negativos y una red con capas convolucionales, submuestreo y capa totalmente conectada. Su enseñanza es que el modelo aprende desde imágenes anotadas; si la anotación o el dataset son pobres, el resultado también será limitado.

La Figura 2, en la página 8, demuestra un flujo de reconocimiento de lesiones quísticas: varias imágenes de entrada pasan por una decisión sí/no y luego producen una salida 3D. Su valor didáctico es mostrar que la IA puede combinar detección y visualización tridimensional, pero no que confirme histología ni reemplace la interpretación profesional.

La Tabla 1, en la página 10, resume estudios representativos. Incluye modelos como VGG-16, YOLOv3, YOLOv2, Inception-v3, Mask R-CNN y pipelines de segmentación. La tabla también muestra limitaciones repetidas: datasets pequeños, un solo centro, ausencia de validación externa, sesgo por selección de ROI, heterogeneidad de etiquetas y generalización limitada.

06

Aplicación clínica para odontología

Situación clínicaConducta prudente
Panorámica con radiolucidez incidentalLa IA puede ayudar a marcar la zona, pero el odontólogo debe revisar imagen completa y clínica.
Duda entre OKC y ameloblastomaCorrelacionar con clínica, imagen completa, evolución, CBCT si está justificada y confirmación histopatológica cuando la lesión se intervenga o el diferencial lo requiera.
Planificación quirúrgicaSegmentación puede orientar volumen y relación anatómica, pero no define márgenes por sí sola.
Modelo con alta precisión en estudioPreguntar si tuvo validación externa, calibración, datos multicéntricos y evaluación por paciente.
Modelo sin explicaciónUsarlo con cautela; revisar si se enfoca en lesión o en artefactos/zonas irrelevantes.
IA sugiere diagnóstico raroConfirmar si esa clase estaba bien representada en entrenamiento antes de confiar en la salida.
Lesiones raras o clases poco representadasMayor riesgo de error por desbalance; preferir “incierto-derivar” antes que etiqueta forzada.
Uso institucional futuroRequiere calidad de datos, privacidad, auditoría, actualización y monitoreo de drift.
Paciente individualLa IA no sustituye diagnóstico clínico, radiológico ni histopatológico cuando este sea necesario.
07

Qué NO debe concluirse del artículo

No debe concluirsePor qué
Que la IA ya diagnostica sola lesiones de los maxilares y tumores maxilofaciales.La revisión muestra potencial, pero exige supervisión y validación externa.
Que una métrica alta equivale a seguridad clínica.Muchas métricas son por lesión, caja, corte o dataset controlado.
Que CBCT, CT o PR con IA sustituyen la biopsia.La IA interpreta imagen, no confirma histopatología.
Que todos los modelos funcionan igual.Rendimiento depende de arquitectura, datos, equipos, anotaciones y validación.
Que Grad-CAM explica completamente el razonamiento.Solo muestra regiones influyentes, no criterios radiológicos completos.
Que data augmentation reemplaza datos reales.Aumenta variaciones, pero no crea verdadera diversidad patológica.
Que “incierto-derivar” ya está validado en todos los modelos.Es una estrategia prudente propuesta, no un resultado clínico universal.
Que la IA reduce morbilidad, recurrencia, retraso diagnóstico, biopsias innecesarias o errores terapéuticos.La revisión no demuestra esos desenlaces duros.
08

Limitaciones importantes

Es una revisión narrativa, no una revisión sistemática estricta ni un metaanálisis; no ofrece estimaciones cuantitativas consolidadas de rendimiento.

SANRA mejora transparencia narrativa, pero no sustituye PRISMA, evaluación formal de riesgo de sesgo ni síntesis cuantitativa.

La búsqueda se limitó a PubMed y Scopus; podrían existir estudios relevantes en otras bases o literatura no incluida.

Los 12 estudios destacados son representativos dentro de esta revisión narrativa; no deben leerse como recuento exhaustivo de toda la literatura.

Muchos estudios revisados son retrospectivos, de un solo centro, con datasets pequeños y sin validación externa.

Algunos estudios usan cortes, regiones de interés o imágenes preseleccionadas, lo que puede inflar el rendimiento frente a una lectura clínica real.

Existe riesgo de fuga de datos si las divisiones entrenamiento/prueba se hacen por imagen y no por paciente.

En estudios que combinan PR y CBCT, pueden existir atajos de modalidad o dependencia del ROI que inflen la generalización aparente.

Los modelos pueden fallar por cambio de dominio: otro equipo, otro protocolo, otro país, artefactos metálicos, diferente prevalencia o distinta distribución de lesiones.

La anotación experta puede variar; si el ground truth es inconsistente, el modelo aprende incertidumbre o sesgos.

Faltan estudios que midan impacto clínico: tiempo real ahorrado, falsos positivos revisados, cambios correctos de tratamiento, reducción de errores o resultados del paciente.

La explicabilidad actual es limitada: un mapa de calor no reemplaza un razonamiento radiológico transparente.

La implementación clínica requiere privacidad, gobernanza, control de calidad, calibración, monitoreo y responsabilidad profesional.

09

Qué aprende el lector de CarpuleNet

El lector aprende que la IA en lesiones de los maxilares no es una sola herramienta. Puede detectar, clasificar o segmentar, y cada tarea responde una pregunta diferente. Una IA que detecta una radiolucidez no necesariamente sabe diferenciar OKC de ameloblastoma; una IA que segmenta una lesión no necesariamente decide el tratamiento.

También aprende que los mejores resultados publicados deben leerse con prudencia. Un modelo puede parecer excelente en su dataset y fallar cuando cambia el equipo, el centro, la población o la calidad de imagen. Una IA útil no es la que más acierta en su tabla, sino la que mantiene rendimiento cuando cambia de clínica, equipo y población.

Finalmente, aprende que la IA debe integrarse como apoyo: marcar casos, reducir omisiones, estandarizar mediciones y ayudar a planificar; pero no debe reemplazar la correlación clínica, la interpretación radiológica ni la confirmación histopatológica cuando corresponde.

10

Conclusión didáctica

Esta revisión narrativa muestra que el deep learning tiene potencial real para apoyar el diagnóstico por imagen de lesiones quísticas de los maxilares y tumores maxilofaciales en panorámica, CBCT y algunos estudios de CT. Los modelos pueden detectar lesiones, sugerir categorías diagnósticas y segmentar volúmenes con resultados prometedores. Sin embargo, el campo todavía está limitado por datasets pequeños, sesgos, falta de validación externa, poca explicabilidad y escasa evidencia de impacto clínico real.

11

Conclusión final

Para CarpuleNet, el mensaje final es que la IA en lesiones quísticas de los maxilares y tumores maxilofaciales debe entenderse como una herramienta de apoyo, no como un diagnóstico autónomo. Puede ayudar a no pasar por alto lesiones, priorizar revisión, sugerir diferenciales y medir volúmenes, pero necesita supervisión profesional, validación externa, transparencia y gobernanza.

La pregunta clínica no debe ser “¿la IA acertó en un estudio?”, sino “¿este modelo funciona en mi población, con mis equipos, en mi flujo de trabajo, con umbrales calibrados, explicaciones útiles y responsabilidad clínica clara?”. Hasta que esa respuesta sea sólida, la IA debe acompañar al odontólogo, no reemplazarlo.

12

Aprendizaje práctico único

En lesiones quísticas de los maxilares y tumores maxilofaciales, la IA puede señalar la lesión y sugerir un diagnóstico, pero la decisión clínica segura sigue dependiendo de imagen completa, contexto clínico e histopatología cuando sea necesaria.

13

Bibliografía

Zhang B, Li Y, Shi J, Liu S, Liu C. Deep learning for imaging diagnosis of jaw cystic lesions and maxillofacial tumors: A narrative review. Journal of International Medical Research. 2025;53(12):1-14. doi:10.1177/03000605251404778.