Edición profesional · 2026
Manual de QA para Sistemas de Inteligencia Artificial
LLMs · RAG · Chatbots · Agentes

Qué es
Un manual de referencia para probar sistemas de IA generativa en producción. Cubre el ciclo completo: qué medir en cada tipo de sistema, con qué herramienta, qué umbral poner en el gate de CI y qué hacer cuando el gate se pone en rojo.
No es un catálogo de herramientas ni una introducción a los LLMs. Asume que ya tienes un sistema delante y una fecha de entrega, y está escrito para llevarte de «¿qué tengo aquí?» a «este es mi plan de pruebas» sin pasar por tres meses de investigación.
Este manual es la base teórica de los 20 módulos de este lab: cada técnica que se explica aquí tiene su implementación ejecutable en modules/, con tests que puedes correr en tu máquina.
Contenido
Fundamentos
IA generativa, fundamentos técnicos de los LLMs, riesgos y marco normativo.
El cambio de paradigma en QA
Por qué QA de IA no es QA tradicional. Taxonomía de sistemas conversacionales.
RAG y evaluación de la generación
Retrieval-Augmented Generation, métricas RAGAS, LLM-as-judge y golden datasets.
Calidad conversacional y robustez
Testing de chatbots, similitud semántica, perturbaciones y deriva semántica.
Seguridad, contexto y alucinaciones
OWASP LLM Top 10 (2025), prompt injection, evaluación multi-turno y detección de alucinaciones.
Operación y herramientas
CI/CD y quality gates, observabilidad y trazabilidad, RAGAS · TruLens · DeepEval.
Agentes, antipatrones y estrategia
Testing de agentes y sistemas multi-agente, antipatrones frecuentes y estrategia integral.
Disciplinas especializadas
Prompt regression, bias y toxicity, cost-aware QA, PII leakage, retrieval avanzado, function calling, human-in-the-loop, reproducibilidad y glosario.
Apéndices
| A | 45 preguntas de consolidación técnica, con respuesta |
| B | Referencias y lecturas recomendadas |
| C | Índice alfabético |
| D | Caso práctico end-to-end: chatbot RAG regulado |
Por dónde empezar
El manual admite dos modos de lectura —guía de arranque o referencia— y propone tres rutas según de dónde vengas:
- Tengo un sistema y una fecha de entrega. Guía de arranque → la ficha de tu tipo de sistema → los capítulos que esa ficha señale → Apéndice D para verlo completo.
- Vengo de QA clásico. Parte I (cap. 1-3) → capítulo 4, que explica qué cambia exactamente → guía de arranque.
- Preparo una entrevista de AI Quality Engineer. Apéndice A (45 preguntas) + el glosario del capítulo 33.
La guía de arranque es deliberadamente mínima: clasificas tu sistema en una de cinco ramas (LLM puro, RAG, chatbot conversacional, agente, multimodal) y cada ficha responde siete preguntas —qué medir primero, con qué herramientas, qué golden dataset mínimo necesitas, qué gate poner en CI, los fallos más frecuentes, qué puedes dejar para después y en qué capítulos ampliar.
Del manual al código
Cada parte del manual tiene módulos ejecutables en el lab:
| Manual | Módulos del lab |
|---|---|
| Parte III · RAG y evaluación | 01, 02, 03, 16 |
| Parte IV · Conversacional y robustez | 04, 13, 17, 18 |
| Parte V · Seguridad | 07, 08, 09 |
| Parte VI · Operación | 12, 15 |
| Parte VII · Agentes | 10 |
| Apéndice D · Caso end-to-end | 20 |
Descarga
PDF de 859 KB, con índice navegable y enlaces internos entre capítulos. Sin registro ni formulario.
Aviso legal
Obra independiente publicada por su autor. No es material oficial, acreditado ni avalado por ISTQB® ni por ninguna de sus organizaciones miembro, y no prepara para certificaciones oficiales; las referencias a los syllabus ISTQB® CT-AI v1.0 y CT-GenAI v1.0 se hacen con fines de cita académica bajo el derecho de cita (art. 32 LPI).
Los umbrales, métricas y ejemplos son orientativos: cada equipo debe calibrarlos contra su baseline, dominio y nivel de riesgo.
© 2026 Gonzalo Moreno Cominero. Todos los derechos reservados. Se permite la descarga y el uso personal; queda prohibida la reproducción total o sustancial sin autorización escrita del autor, salvo citas breves con atribución.