Resumen:
Este trabajo final de graduación evalúa la efectividad de los Modelos de Lenguaje Grande (LLM) en la generación automatizada de casos de prueba basados en requerimientos para acelerar la verificación de software crítico en la industria aeroespacial. Mediante un enfoque alternativo, se comparó el desempeño cuantitativo y cualitativo de tres paradigmas de IA: RAG, prompts avanzados y agentes autónomos. Se contrasta el modelo comercial GPT-5 frente al de código abierto Mistral (7B).
Las evaluaciones emplearon un benchmark de cerca de 90 requerimientos simulados bajo la sintaxis estandarizada EARS, de los cuales 15 fueron utilizados activamente para validación y recolección de resultados. Los resultados cuantitativos demostraron una reducción drástica del esfuerzo inicial, disminuyendo el tiempo de generación de más de 50 minutos por requerimiento por la vía manual a menos de 1 minuto bajo el entorno asistido. A nivel de desempeño, la combinación de GPT-5 con prompts avanzados obtuvo la mayor precisión, con un puntaje F1 promedio de 0.849, mientras que la arquitectura agéntica basada en LangGraph con GPT-5 exhibió la mayor estabilidad y consistencia iterativa, alcanzando una sensibilidad promedio de 0.895 y reduciendo la omisión de pruebas gracias a la especialización de tareas en nodos acotados.
Por el contrario, el modelo Mistral evidenció notables deficiencias fuera de la lógica puramente booleana, mostrando una alta variabilidad y errores al procesar requerimientos con variables de rango continuo, tolerancias y operaciones matemáticas complejas.
Asimismo, el análisis cualitativo reveló vulnerabilidades inherentes a la naturaleza probabilística de los LLM, tales como alucinaciones estadísticas, omisión sistemática de condiciones de frontera y una marcada tendencia al sobretesteo (over-testing), que genera datos redundantes y exige depuración humana adicional. Como contribución científica y tecnológica fundamental, la investigación aporta una guía práctica de integración alineada rigurosamente con el estándar DO-178C y los siete principios de la hoja de ruta de seguridad para IA de la Administración Federal de Aviación (FAA, 2024), además de un prototipo funcional interactivo desarrollado con LangChain, LangGraph y React que permite la interacción dinámica del usuario con modelos LLM para la generación de casos de prueba.
Finalmente, se concluye categóricamente que, debido al comportamiento no determinista de la IA generativa, las herramientas basadas en LLM no cumplen con los criterios de repetibilidad exigidos para la calificación de herramientas bajo la norma DO-330, lo que imposibilita su uso para reemplazar o automatizar de forma autónoma cualquier actividad de verificación. Por lo tanto, el diseño arquitectónico aeroespacial debe configurarse estrictamente bajo el paradigma de "humano en el flujo de trabajo" (human-in-the-loop). En este esquema, el sistema opera exclusivamente como un copiloto de ingeniería que acelera las propuestas iniciales, mientras que el profesional humano retiene de forma obligatoria la supervisión crítica, la validación de matrices de trazabilidad y la responsabilidad final de la seguridad del software de aviónica.