CarpuleNetRed global de odontología
Software
OrtodonciaBMC Oral Health2026

INTELIGENCIA ARTIFICIAL EN LA PLANIFICACIÓN ORTODÓNCICA

Comparación entre sistemas basados en reglas, aprendizaje automático y modelos híbridos

La revisión incluyó diecinueve estudios sobre sistemas de inteligencia artificial y apoyo a decisiones en ortodoncia. Las tareas más estudiadas fueron extracción frente a no extracción, selección del patrón de extracción, clasificación esquelética, estimación de dificultad y apoyo a varias decisiones del plan. Algunos modelos informaron exactitudes superiores al 80 % y, en condiciones concretas, superiores al 90 %. Estas cifras representan principalmente coincidencia con decisiones de ortodoncistas utilizadas como referencia. No demuestran que la IA produjera mejores resultados, mayor estabilidad, menor reabsorción o mayor satisfacción. Además, la mayoría de los estudios fue retrospectiva, de un solo centro y con poca validación externa. Los sistemas basados en reglas, lógica difusa y redes bayesianas ofrecieron una lógica potencialmente más visible o interpretable, mientras algunos modelos basados en datos informaron mayor discriminación en sus propios estudios. No puede afirmarse que un paradigma sea superior porque casi nunca fueron evaluados directamente con los mismos pacientes y tareas. La IA funcionó mejor en decisiones delimitadas que en planes completos. En un estudio piloto que evaluó un único caso complejo, tres modelos generales de lenguaje obtuvieron puntuaciones inferiores a los planes elaborados por ortodoncistas y produjeron algunos pasos clínicamente poco plausibles. Ese resultado no puede generalizarse a todos los modelos, casos o sistemas entrenados específicamente en ortodoncia. Su papel actual debe ser de apoyo o segunda opinión, no de planificador autónomo.

DOI: 10.1186/s12903-026-08854-xFuente originalPublicado: 21 de agosto de 2026
Ortodoncia

INTELIGENCIA ARTIFICIAL EN LA PLANIFICACIÓN ORTODÓNCICA

Comparación entre sistemas basados en reglas, aprendizaje automático y modelos híbridos

DECISIÓN CLÍNICAAPRENDIZAJEVALIDACIÓN
01

1. ¿Qué significa usar inteligencia artificial en ortodoncia?

En este contexto, la inteligencia artificial reúne sistemas capaces de analizar datos clínicos, cefalométricos, radiográficos o demográficos para producir una clasificación, una probabilidad o una recomendación.

No todos estos sistemas “aprenden” automáticamente. Algunos aplican reglas programadas por expertos, mientras otros ajustan patrones a partir de datos.

La IA no necesariamente comprende el caso como lo hace un clínico. Puede reconocer patrones semejantes a los de casos anteriores y asociarlos con decisiones tomadas por especialistas.

Una predicción estima qué podría ocurrir. Una recomendación transforma esa estimación, junto con objetivos y preferencias, en una propuesta clínica. Por ejemplo, predecir alto riesgo de fracaso de una máscara facial no decide por sí solo si conviene camuflaje, observación o cirugía futura.

02

2. Diagnóstico, clasificación y planificación no son lo mismo

TareaEjemplo ortodóncicoNivel de complejidad
ClasificaciónDeterminar si un patrón es Clase I, II o III.Tarea más delimitada, aunque depende de los criterios diagnósticos y de la calidad de los registros.
PredicciónEstimar riesgo de fracaso de crecimiento o duración de tracción de un canino.Intermedia: estima qué podría ocurrir.
Decisión puntualRecomendar extracción o no extracción.Alta relevancia clínica: transforma información, objetivos y preferencias en una propuesta.
Planificación completaIntegrar diagnóstico, objetivos, anclaje, mecánica, secuencia y retención.Muy compleja.
Seguimiento dinámicoModificar el plan según respuesta real durante el tratamiento.Aún más exigente.
03

3. ¿Qué es un sistema basado en reglas?

Es un sistema construido con reglas explícitas del tipo «si ocurre A y B, entonces recomendar C». Las reglas proceden de expertos, guías o protocolos clínicos.

Su principal ventaja es la transparencia: el profesional puede entender por qué se llegó a una recomendación. Su limitación es que resulta difícil representar todas las excepciones, preferencias y situaciones fronterizas.

04

4. ¿Qué es la lógica difusa?

La lógica difusa permite manejar categorías graduales en lugar de decisiones estrictamente binarias. Por ejemplo, un paciente puede presentar un patrón moderadamente hiperdivergente en lugar de ser clasificado simplemente como normal o hiperdivergente.

La lógica difusa no significa que el sistema sea impreciso. Significa que permite representar grados intermedios en variables que clínicamente no poseen límites absolutos.

05

5. ¿Qué es una red bayesiana?

Es un modelo probabilístico que representa dependencias entre variables. Estas relaciones no demuestran necesariamente causalidad, salvo que el diseño del modelo y los datos permitan justificarla.

En ortodoncia se ha utilizado para clasificar necesidad de tratamiento y para analizar factores asociados a caninos maxilares incluidos, como angulación, posición sectorial o bilateralidad.

06

6. ¿Qué es el aprendizaje automático basado en datos?

Es un enfoque en el que el modelo ajusta patrones a partir de conjuntos de casos previos. Incluye redes neuronales, máquinas de soporte vectorial, bosques aleatorios, regresiones y métodos de gradient boosting.

Aunque aprende a partir de datos, las personas siguen decidiendo qué pacientes incluir, qué variables utilizar, cómo definir la respuesta correcta y cómo evaluar el rendimiento. Por eso, un sistema basado en datos tampoco es completamente objetivo.

Puede detectar combinaciones complejas de variables que no fueron formuladas como reglas explícitas. Algunos modelos complejos, especialmente ciertas redes neuronales o conjuntos de múltiples algoritmos, pueden resultar difíciles de interpretar. Otros, como regresiones o árboles sencillos, permiten identificar con mayor claridad la contribución de las variables.

07

7. ¿Qué es un sistema basado en casos?

Busca pacientes anteriores parecidos y adapta sus soluciones al caso nuevo. Se asemeja a la forma en que un clínico recuerda casos tratados previamente.

Su utilidad depende de que la base contenga casos realmente comparables y de que la similitud se defina con variables clínicamente relevantes.

08

8. ¿Qué es un sistema híbrido?

Combina dos o más enfoques, por ejemplo reglas clínicas con aprendizaje automático o recuperación de casos con predicción estadística.

En teoría, puede mantener cierta explicabilidad y aprovechar la capacidad de reconocer patrones complejos. En la práctica, los sistemas híbridos todavía han sido poco evaluados.

09

9. ¿Qué significa exactitud?

La exactitud es la proporción total de casos clasificados correctamente según un estándar de referencia.

Si 90 de 100 pacientes no requieren extracción, un sistema que responda siempre “no extracción” alcanzaría 90 % de exactitud y, aun así, sería inútil para detectar los diez casos de extracción. Por eso deben revisarse sensibilidad, especificidad, equilibrio entre categorías y matrices de confusión.

MétricaQué respondeLimitación
Exactitud¿Cuántas decisiones coincidieron con la referencia?Puede ocultar mal rendimiento en grupos pequeños.
Sensibilidad¿Cuántos casos positivos fueron detectados?Depende de cómo se defina el caso positivo.
Especificidad¿Cuántos casos negativos fueron reconocidos?No indica utilidad clínica por sí sola.
AUC¿Qué tan bien separa dos grupos a distintos umbrales?No informa calibración ni demuestra que usar el modelo mejore una decisión clínica.
Kappa¿Cuánto acuerdo existe más allá del azar?Indica acuerdo, no calidad clínica; dos evaluadores pueden coincidir en una decisión sesgada.
10

10. ¿Por qué 90 % de exactitud no significa 90 % de planes correctos?

Un modelo puede acertar con frecuencia en una tarea sencilla, como extracción frente a no extracción, y fallar al elegir qué dientes extraer, cómo controlar el anclaje o cómo terminar la oclusión.

Además, si el estándar de referencia es la decisión de un especialista, la IA aprende a reproducir esa decisión. No demuestra que el plan sea el único correcto ni que produzca el mejor resultado.

11

11. ¿Qué es sobreajuste?

12

¿Qué es la calibración?

La calibración indica si las probabilidades estimadas se parecen a lo que realmente ocurre. Si un sistema asigna 80 % de riesgo a cien pacientes semejantes, aproximadamente ochenta deberían presentar el resultado para que estuviera bien calibrado. Un modelo puede separar bien grupos y, aun así, exagerar o subestimar los porcentajes de riesgo.

Ocurre cuando el modelo aprende demasiado bien las peculiaridades de sus datos de entrenamiento y parece excelente en esos casos, pero pierde rendimiento al evaluar pacientes nuevos.

Existe fuga de información cuando datos que no deberían estar disponibles durante el entrenamiento terminan influyendo en el modelo. Por ejemplo, si radiografías del mismo paciente aparecen tanto en entrenamiento como en prueba, el resultado puede parecer mejor de lo que realmente es.

Cuando un modelo utiliza muchas variables con pocos pacientes, puede encontrar asociaciones accidentales que no se repiten en otros grupos.

El riesgo aumenta cuando existen pocas muestras, muchas variables y algoritmos complejos.

13

12. ¿Qué es validación interna y externa?

TipoDescripciónValor clínico
InternaSe prueba con datos del mismo entorno de desarrollo.Estima el rendimiento dentro del entorno original y puede seguir siendo optimista.
ExternaSe prueba en otra clínica, país, población o equipo.Evalúa la generalización a otros datos, centros o poblaciones.
ProspectivaSe prueba con pacientes nuevos durante la atención real.Su valor aumenta si se realiza en centros independientes.
Impacto clínicoEstudia qué ocurre cuando la herramienta se utiliza en la práctica.Evalúa si mejora decisiones, eficiencia o resultados.
14

13. ¿Qué significa explicabilidad?

Es la capacidad de entender qué variables influyeron en la recomendación y cómo se llegó a ella.

Una explicación visual o una lista de variables no garantiza que el razonamiento sea clínicamente correcto. La explicabilidad ayuda a revisar una recomendación, pero no convierte por sí sola un modelo en seguro.

En decisiones de gran impacto, como cirugía ortognática frente a camuflaje, una predicción sin explicación limita la posibilidad de revisar errores, discutir alternativas y obtener consentimiento informado.

15

¿Qué quiso investigar la revisión?

La revisión buscó identificar qué sistemas de inteligencia artificial se han utilizado para apoyar decisiones ortodóncicas, comparar su rendimiento con especialistas y analizar cómo el tipo de aprendizaje afecta exactitud, transparencia y posible integración clínica.

16

¿Qué tipo de estudios encontró?

Se incluyeron 19 estudios. La mayoría fueron retrospectivos, utilizaron datos de una sola institución y evaluaron modelos después de desarrollarlos, sin incorporarlos de forma prospectiva a la atención clínica.

Las tareas, poblaciones y métricas fueron demasiado diferentes para combinarse en un metaanálisis.

17

¿Qué decisiones se estudiaron con mayor frecuencia?

Extracción frente a no extracción.

Selección de dientes específicos para extracción.

Clasificación esquelética.

Riesgo de fracaso en tratamiento temprano de Clase III.

Selección de headgear.

Necesidad de tratamiento ortodóncico.

Pronóstico y duración de tracción de caninos incluidos.

Planificación secuencial de diagnóstico y tratamiento.

Generación de listas de problemas y planes completos.

18

1. Decisiones de extracción

Fue el grupo más estudiado. Algunas redes neuronales alcanzaron aproximadamente 93–94 % de exactitud para decidir extracción o no extracción en condiciones específicas.

En un estudio, la exactitud aumentó hasta aproximadamente 97 % al excluir los casos “borderline”. Esto demuestra que los casos fáciles elevan el promedio, mientras las decisiones más difíciles siguen siendo precisamente aquellas en las que la herramienta debería aportar mayor ayuda.

Algunas de las cifras más altas procedieron de evaluaciones internas o muestras seleccionadas. El rendimiento puede disminuir cuando el sistema se aplica a pacientes de otro centro.

Cuando la tarea se volvió más específica —determinar exactamente qué dientes extraer— el rendimiento descendió alrededor de 84 %.

Las cifras de extracción procedieron de modelos y poblaciones diferentes y no deben interpretarse como el intervalo de rendimiento de un único sistema.

TareaRendimiento informadoInterpretación
Extracción / no extracción≈80–94 % de exactitud; AUC cercana a 0,91 en algunos estudios.Capacidad aparentemente alta para reproducir la referencia utilizada dentro de esos conjuntos de datos.
Patrón específico de extracción≈84 % en algunos modelos.Tarea con múltiples categorías; acertar la combinación exacta es más difícil que responder una pregunta binaria.
Modelos matemáticos o basados en conocimiento≈86–90 % de coincidencia con el ortodoncista de referencia.Transparencia mayor, pero dependen de la filosofía original.
19

2. Clasificación esquelética y pronóstico

Los modelos evaluaron clasificación de patrones Clase I, II y III, predicción temprana desde fotografías y agrupación de fenotipos con diferentes riesgos de fracaso.

Clasificación de patrones esqueléticos Clase I y Clase II a partir de variables cefalométricas: exactitud cercana a 0,87 y AUC aproximada de 0,92 en modelos completos.

Modelos simplificados con ANB y Wits: exactitud cercana a 0,78. ANB y Wits describen relaciones sagitales, pero pueden verse influidos por rotación maxilar, posición del nasion y plano oclusal.

Predicción temprana de Clase III desde fotografías de perfil: mejor exactitud alrededor de 76 %. Una fotografía contiene información útil, pero no sustituye examen clínico, oclusión, cefalometría ni seguimiento del crecimiento.

Un estudio agrupó pacientes tratados tempranamente de Clase III y observó tasas de fracaso muy diferentes entre fenotipos. Esas cifras no constituyen un pronóstico universal para todos los pacientes Clase III.

La IA puede ayudar a reconocer patrones, pero no sustituye la evaluación de crecimiento, función, tejidos blandos, expectativas y evolución clínica.

20

3. Caninos maxilares incluidos

Una red bayesiana permitió explorar dependencias probabilísticas entre posición radiográfica, angulación, bilateralidad y complejidad o duración de la tracción.

La duración real también depende de la técnica quirúrgica, la mecánica, el espacio disponible, la posible anquilosis, la cooperación y la experiencia clínica.

Su ventaja principal fue mostrar probabilidades y dependencias entre factores, en lugar de ofrecer una decisión opaca.

21

4. Selección de aparato extraoral o tracción extraoral (headgear)

Un sistema difuso utilizó overjet, overbite y ángulo del plano mandibular para recomendar aparato extraoral cervical, recto o alto.

La tracción cervical dirige la fuerza con un componente más inferior, la alta con un componente más superior y la recta ocupa una posición intermedia. La elección depende del patrón vertical, el objetivo y la biomecánica.

En 95,6 % de los casos, al menos seis de ocho expertos consideraron aceptable la recomendación. Esta medida refleja aceptabilidad clínica colectiva, no exactitud frente a una única respuesta correcta.

22

5. Sistemas de apoyo para varias decisiones consecutivas

Algunos modelos integraron variables demográficas, clínicas y cefalométricas para predecir componentes consecutivos como diagnóstico esquelético, extracción, anclaje y modalidad terapéutica. No necesariamente definieron cada arco, attachment, fuerza, cita y fase de finalización.

Las exactitudes medias se situaron aproximadamente entre los 80 y los 90 %, con promedios globales cercanos a 84–85 %.

El promedio global puede ocultar que algunas decisiones fueron predichas mejor que otras. Un único porcentaje no garantiza que todas las etapas funcionen con la misma fiabilidad.

Aunque se aproximan más al flujo clínico real, continúan dependiendo de las decisiones históricas usadas para entrenarlos.

23

6. Generación de planes completos

Los resultados fueron considerablemente menos favorables cuando la IA tuvo que crear planes amplios y coherentes.

En problemas multilabel, la precisión indica qué proporción de las propuestas generadas era correcta según la referencia, mientras el recall indica qué proporción de los elementos esperados consiguió recuperar. Un valor cercano a 0,48 significa que el sistema omitió o añadió una cantidad importante de componentes del plan.

SistemaResultado principalInterpretación
Modelo especializado de aprendizaje automáticoListas de problemas con precisión 0,65 y recall 0,55; planes con precisión y recall cercanos a 0,48.Las listas de problemas fueron mejores que los planes; hubo omisiones y propuestas incorrectas.
Tres modelos generales de lenguaje en un estudio pilotoPuntuaciones medias de 38–47 frente a ≈78 para planes de ortodoncistas.Inferiores a especialistas en un único caso complejo; no generalizable a todos los modelos o casos.
OrtodontistasMayor coherencia y preferencia por los evaluadores.Obtuvieron puntuaciones superiores y fueron preferidos con mayor frecuencia por los evaluadores.

En un estudio piloto con un único caso complejo, tres modelos generales de lenguaje obtuvieron puntuaciones inferiores a los ortodoncistas y produjeron algunos pasos clínicamente poco plausibles. No debe generalizarse este hallazgo a todos los modelos, todos los casos ni sistemas específicamente entrenados en ortodoncia.

24

¿Qué enfoque mostró mayor rendimiento?

Los modelos basados en datos tendieron a informar cifras de discriminación más altas en sus respectivos estudios.

Los sistemas basados en reglas, lógica difusa y redes bayesianas ofrecieron una lógica potencialmente más visible o interpretable que muchos modelos complejos de aprendizaje automático. Sin embargo, no toda red bayesiana o sistema difuso es automáticamente fácil de comprender.

No existieron comparaciones directas suficientes para demostrar que un enfoque fuera superior a otro, porque se utilizaron pacientes, tareas, estándares y tamaños de muestra diferentes.

EnfoqueFortalezaLimitación
Reglas clínicasExplicación clara.Difícil representar excepciones.
Lógica difusaManeja situaciones fronterizas.Depende de reglas y pertenencias definidas por expertos.
Red bayesianaMuestra probabilidades e incertidumbre.Requiere supuestos sobre relaciones entre variables.
Machine learningDetecta patrones complejos y puede lograr alta exactitud.Menor transparencia y riesgo de sesgo de datos.
Basado en casosRecupera ejemplos clínicos similares.Puede fallar si la base no contiene casos comparables.
HíbridoBusca equilibrar predicción y explicación.Mayor complejidad y evidencia limitada.
25

¿Por qué las cifras pueden estar sobreestimadas?

Un estudio puede probar numerosos algoritmos y publicar principalmente el de mejor desempeño. Si no se informa todo el proceso, el resultado final puede parecer más sólido de lo que realmente es.

Si una categoría es mucho más frecuente que otra, el modelo puede aprender a favorecerla. Por eso deben revisarse sensibilidad, especificidad y matrices de confusión, no solo exactitud.

Muestras pequeñas.

Datos de una sola clínica.

Casos seleccionados o con resultados excelentes.

Poca validación externa.

Modelos complejos con pocos pacientes.

Separación simple entre entrenamiento y prueba.

Publicación preferente del algoritmo con mejor resultado.

Información incompleta sobre ajuste de hiperparámetros.

Uso de la misma filosofía clínica como entrenamiento y referencia.

26

¿Qué significa que el experto sea el estándar de referencia?

La respuesta considerada correcta fue con frecuencia la decisión o el plan de uno o varios ortodoncistas.

Esto es práctico, pero problemático: los expertos pueden discrepar, tener filosofías diferentes o elegir varias opciones aceptables.

27

¿Qué información estuvo ausente o insuficientemente representada en muchos modelos?

Manejo de datos faltantes o registros incompletos.

Calidad de la dentición, restauraciones y estado pulpar cuando fuera relevante.

Riesgo de reabsorción radicular según el movimiento planeado.

Anatomía y límites alveolares.

Preferencias del paciente.

Estado periodontal.

Riesgo de caries.

Cooperación esperada.

Hábitos y función.

Salud sistémica.

Condiciones económicas y acceso al seguimiento.

Perfil y expectativas estéticas.

Experiencia previa del paciente.

Posibilidad real de retención y estabilidad.

Un plan técnicamente posible puede ser inadecuado si no integra estas dimensiones.

28

¿Por qué la explicabilidad es una cuestión clínica y ética?

El paciente y el profesional necesitan comprender por qué se propone una extracción, una cirugía o un tratamiento de camuflaje.

Una recomendación sin explicación dificulta discutir riesgos, alternativas y preferencias, especialmente en decisiones irreversibles.

29

¿Puede la IA reducir la variabilidad entre ortodoncistas?

30

¿Puede una IA superar al especialista si fue entrenada con decisiones de especialistas?

Puede superar la coincidencia de un clínico individual con la opinión mayoritaria, porque combina patrones de muchos casos y aplica siempre el mismo criterio. Sin embargo, si fue entrenada únicamente con decisiones históricas, su límite sigue siendo la calidad de esas decisiones. Puede imitar una filosofía de tratamiento con gran consistencia y aun así no saber cuál opción produce mejor estabilidad, salud periodontal o satisfacción. Para demostrar una verdadera mejora, tendría que compararse la atención con y sin IA y observar resultados reales en pacientes, no solo coincidencia con planes anteriores.

Puede ayudar a estructurar información, recordar variables y ofrecer una segunda opinión.

En educación, los sistemas basados en reglas pueden ayudar a discutir razonamientos, pero también transmitir una filosofía sesgada. Deben utilizarse para comparar alternativas, no para enseñar que existe una única respuesta automática.

También puede estandarizar errores si fue entrenada con datos sesgados o decisiones inconsistentes. Al automatizarse, un sesgo pequeño puede aplicarse repetidamente a cientos o miles de pacientes. Reducir variabilidad no siempre significa mejorar calidad.

31

¿En qué situaciones parece más útil actualmente?

Segunda opinión en decisiones de extracción limítrofes.

Clasificación esquelética y estratificación de riesgo.

Organización de listas de problemas.

Apoyo educativo para estudiantes.

Visualización de probabilidades y factores relevantes.

Estandarización de protocolos departamentales.

Identificación de casos que necesitan revisión experta adicional.

32

¿En qué situaciones no debe actuar sola?

Decisión de cirugía ortognática frente a camuflaje.

Casos sindrómicos o con asimetrías severas.

Pacientes con periodonto comprometido.

Tratamientos con alto riesgo de reabsorción.

Pacientes en crecimiento con respuesta incierta.

Planes completos con mecánica y secuencia detallada.

Decisiones irreversibles sin revisión profesional.

33

Aplicación clínica

Solicitar probabilidades acompañadas de información sobre calibración, incertidumbre y población de validación, no solo una etiqueta.

Registrar el nombre y la versión del sistema utilizado, porque una actualización puede cambiar el resultado.

Fotografías, radiografías y datos clínicos son información sensible. Solo deben utilizarse plataformas autorizadas, con seguridad y reglas claras sobre almacenamiento y entrenamiento.

Utilizar la IA como apoyo, no como sustituto del diagnóstico.

Revisar qué población se utilizó para entrenar el modelo.

Comprobar si existe validación externa.

Solicitar probabilidades y explicaciones, no solo una etiqueta.

Comparar la recomendación con los registros completos del paciente.

No aceptar una decisión de extracción sin valorar tejidos blandos, periodonto y objetivos.

Documentar cuándo la recomendación de la IA fue modificada por el clínico.

Evitar introducir datos identificables en herramientas no autorizadas.

Explicar al paciente el papel real de la herramienta.

Mantener la responsabilidad profesional sobre la decisión final.

34

Limitaciones importantes de la revisión y de la evidencia

Existe una inconsistencia interna: el texto clasifica diez estudios como moderados, siete como serios y uno como bajo, lo que suma dieciocho de los diecinueve incluidos. No queda claro cuál fue la categoría del estudio restante.

La herramienta ROBINS-I fue diseñada principalmente para estudios no aleatorizados de intervenciones y puede no captar adecuadamente problemas específicos de modelos predictivos, como sobreajuste, calibración o fuga de datos.

La pregunta original del protocolo buscaba comparar aprendizaje basado en casos frente a reglas y luego se amplió antes del cribado de textos completos. La revisión terminó siendo más amplia que su planteamiento inicial.

La revisión describió diferencias entre paradigmas, pero no pudo determinar cuál era superior porque casi nunca fueron evaluados en los mismos pacientes y con la misma tarea.

Al menos uno de los estudios incluidos era una prepublicación sin revisión por pares formal en el momento citado.

Los autores consideran baja la confianza global en la evidencia, pero no presentan una graduación formal y detallada de certeza para cada tarea.

No existe un conjunto sólido de estudios que demuestre que usar la IA mejore decisiones, reduzca complicaciones, ahorre tiempo o mejore resultados reales en la práctica.

Solo se incluyeron 19 estudios.

La mayoría fue retrospectiva.

Predominaron muestras de una sola institución.

La validación externa fue escasa.

El riesgo de sesgo fue moderado o serio en la mayoría.

El artículo informa que solo uno fue considerado de bajo riesgo; la mayoría fue moderada o seria, aunque el recuento narrativo no cubre claramente los diecinueve estudios.

Las tareas y métricas fueron muy heterogéneas.

No se pudo realizar metaanálisis.

Muchos modelos reprodujeron decisiones expertas y no resultados clínicos.

La fiabilidad entre expertos se informó pocas veces.

Calibración, curvas de decisión y resultados centrados en el paciente casi no se evaluaron.

Los sistemas generalistas de lenguaje rindieron peor en planes completos.

La revisión estaba aceptada, pero aún no había pasado por la edición final de la revista. Las cifras, tablas o redacción podían corregirse en la versión definitiva.

35

Entonces, ¿qué aprendemos del artículo?

La IA funciona mejor en tareas bien delimitadas que en planes completos.

Las decisiones de extracción fueron las más estudiadas.

Una exactitud alta suele significar semejanza con expertos, no mejor resultado clínico.

Los sistemas basados en reglas son más transparentes.

El aprendizaje automático puede lograr mayor discriminación, pero es más opaco.

Los modelos híbridos buscan equilibrar ambas ventajas.

La validación externa es indispensable.

Los modelos de lenguaje generalistas no están preparados para planificar de forma autónoma.

La IA puede servir como segunda opinión y herramienta educativa.

La responsabilidad clínica continúa siendo del ortodoncista.

36

Conclusión final

37

Aprendizaje práctico

Clasificar no es lo mismo que planificar.

Exactitud no equivale a calidad clínica ni a probabilidades bien calibradas.

La referencia experta también puede ser imperfecta.

La validación interna no garantiza generalización.

La validación externa es esencial.

La explicabilidad importa en decisiones irreversibles.

Los modelos pueden reproducir y amplificar sesgos locales.

Los planes completos siguen siendo difíciles; la evidencia sobre modelos generales procede de un estudio piloto con un caso.

La IA puede apoyar enseñanza y segunda opinión.

El ortodoncista mantiene la responsabilidad final.

38

Bibliografía del artículo

Formato Vancouver

Baxmann BM, Zsoldos M, Kárpáti K. AI in orthodontic treatment planning: a systematic review comparing learning approaches. BMC Oral Health. 2026. doi:10.1186/s12903-026-08854-x.

Formato APA 7

Baxmann, B. M., Zsoldos, M., & Kárpáti, K. (2026). AI in orthodontic treatment planning: A systematic review comparing learning approaches. BMC Oral Health. https://doi.org/10.1186/s12903-026-08854-x

DOI: 10.1186/s12903-026-08854-x

Enlace directo de ingreso al artículo: https://doi.org/10.1186/s12903-026-08854-x