Pipeline end-to-end de IA para análisis de audio
Desarrollo y mantengo un sistema de inteligencia artificial para analizar grandes volúmenes de llamadas reales de forma automatizada, rápida y segura: transcripción con Whisper, análisis con LLMs locales, evaluación, persistencia y APIs.
Análisis automático de llamadas a gran volumen
El sistema está diseñado para convertir audios reales en resultados estructurados que pueden ser utilizados por herramientas internas y otros sistemas de negocio. Procesa llamadas de principio a fin: ingesta, preparación, transcripción, enrutamiento, evaluación y exposición de resultados mediante APIs.
En operación ha superado los 250.000 audios evaluados automáticamente y está preparado para trabajar con lotes grandes de llamadas manteniendo trazabilidad, control de estados y tiempos de proceso optimizados.
Muchas llamadas, procesadas rápido
La arquitectura se ha optimizado para aumentar el número de llamadas procesadas por hora y reducir esperas en el recorrido completo. El sistema ha alcanzado picos registrados de 306 audios por hora dentro del pipeline real de producción.
Las cifras se presentan de forma agregada y anonimizadas. No se publican audios, transcripciones, clientes ni detalles sensibles del entorno.
Pipeline completo de producción
Ingesta y validación
Recepción, validación y preparación de cada audio antes de introducirlo en el pipeline.
Normalización y trazabilidad
Control de formato, disponibilidad, estado y trazabilidad de cada elemento durante todo el recorrido.
Transcripción con Whisper
Transcripción sobre GPU y almacenamiento estructurado de transcripciones y metadatos reutilizables.
Enrutamiento con LLMs locales
Análisis de transcripciones para decidir qué lógica, criterios o evaluaciones aplicar, sirviendo modelos mediante vLLM.
Evaluación automatizada
Generación de respuestas estructuradas siguiendo criterios de negocio, listas para almacenamiento, consulta e integración.
APIs y control operativo
Persistencia en base de datos, exposición mediante FastAPI, workers independientes, reintentos, estados, errores y monitorización de tiempos.
Más que usar modelos
Diseño y mantengo la infraestructura para ejecutar IA de forma fiable: servicios backend en Python, integración de Whisper y LLMs locales, pipelines distribuidos, workers especializados, procesamiento asíncrono, optimización GPU, APIs con FastAPI, Docker, persistencia, trazabilidad, control de errores y análisis de cuellos de botella.
Entorno on-premise con 2× NVIDIA RTX PRO 6000 Blackwell, orientado a mantener audios, transcripciones e información sensible dentro de la infraestructura de la organización.
Por confidencialidad profesional no se publican repositorios privados, audios, transcripciones, prompts internos, datos de clientes ni detalles sensibles de infraestructura. Las cifras se presentan agregadas y anonimizadas.