// Proyecto · ML · Pipeline Híbrido · Producción

Clasificar transacciones bancarias
sin enviarlo todo al LLM.

Construí ClarityBank para demostrar que la IA en producción requiere pensar en coste, latencia y privacidad. Un pipeline de dos niveles: modelo local para el 84% de los casos, LLM solo cuando realmente lo necesita. 96.1% de precisión combinada.

// Métricas del proyecto

Precisión combinada
96.1%
L1 + L2 pipeline
Reducción de coste
95.6%
vs. enviar todo al LLM
Tests
55
0 fallidos
Latencia media (L1)
~55ms
path local sin LLM

El problema

Enviar todo al LLM
no es una estrategia.
Es un error.

01

Coste desproporcionado. Enviar cada transacción a un LLM grande cuesta ~€1,909/mes para 2.1 millones de transacciones. El 84% de esos casos los resuelve un modelo local por €84.

02

Latencia innecesaria. Para transacciones claras, una llamada a API añade latencia sin aportar valor. El modelo local tarda ~55ms; el LLM, segundos.

03

PII sin protección. Los datos bancarios contienen información personal sensible. Enviarla a una API externa sin anonimización previa incumple GDPR y genera riesgo real.

04

Evaluación deshonesta. Muchos sistemas reportan accuracy sin separar train/test correctamente, sin manejar desbalanceo de clases ni declarar umbrales de decisión explícitos.


Cómo funciona

PASO 01

Anonimización PII

Presidio (NER) + regex detecta y sustituye nombres, IBANs y datos personales antes de que salgan del sistema. 100% recall de PII, 0 falsos positivos en datos de prueba.

PASO 02

LightGBM (nivel 1)

Modelo local clasifica la transacción. Si la confianza supera 0.70, devuelve resultado sin llamar al LLM. 91.2% accuracy en test set, ~55ms de latencia media. Cubre el 84% de los casos.

PASO 03

Escalado a LLM (nivel 2)

Solo el 16% de transacciones ambiguas llegan a Azure OpenAI gpt-4o-mini. La precisión combinada sube al 96.1%. Coste total: ~€84/mes para 2.1M transacciones.

PASO 04

Detección de anomalías

Pipeline paralelo que marca el 1.2% de transacciones como atípicas para revisión manual. Completamente independiente del pipeline de clasificación, sin interferir en latencia.

ML clásico + LLM
donde cada uno gana.

Ni ML puro ni LLM puro. Cada nivel resuelve lo que mejor sabe hacer, coordinados por un FastAPI que gestiona el routing según confianza.

Python 3.11+ LightGBM Azure OpenAI gpt-4o-mini FastAPI sentence-transformers Presidio Streamlit SQLite scikit-learn Pytest · 55 tests

Qué demuestra

Ingeniería de costes

Routing inteligente ML→LLM

El sistema decide autónomamente qué nivel invocar según la confianza del modelo local. €84 vs €1,909/mes para el mismo volumen — reducción del 95.6% sin sacrificar precisión.

Privacidad por diseño

Anonimización antes de la API

Ningún dato personal sale del sistema sin ser anonimizado primero. 100% recall de PII en datos de prueba, integrado como capa obligatoria del pipeline, no opcional.

Evaluación rigurosa

Métricas honestas con PR-AUC

Umbral de decisión declarado explícitamente (0.70), PR-AUC como métrica primaria para datos desbalanceados, separación train/test sin data leakage verificado por assertions.

Calidad de producción

55 tests, 0 fallidos

Suite de tests que cubre el pipeline completo: clasificación, anonimización, detección de anomalías y routing. Sin mocks de conveniencia que enmascaren comportamiento real.


¿Te interesa este proyecto?

Relevante si...

  • Buscas un AI Engineer que piense en coste, latencia y privacidad desde el diseño
  • Quieres ver ML en producción con evaluación rigurosa y tests reales
  • Necesitas implementar un pipeline híbrido ML+LLM para un caso similar
  • Valoras la ingeniería de costes tanto como la precisión del modelo

Menos relevante si...

  • Necesitas clasificación en tiempo real con latencia <5ms (no es el objetivo de este diseño)
  • Tu caso no tiene restricciones de PII ni preocupación por coste de LLM
  • Buscas un modelo de lenguaje grande sin componente ML clásico

Proyectos relacionados

PyTorch · ONNX · React

Fraud Autoencoder

Detección de fraude sin etiquetas de fraude. PR-AUC 0.37 frente a 0.11 del baseline. Demo en navegador.

Ver caso completo →
RAG · Azure AI Search · FastAPI

RAG Assistants Platform

Multi-asistente con un índice por asistente, búsqueda híbrida y fallback honesto. 56 tests, construida en 7 días.

Ver caso completo →

Contacto

¿Buscas un AI Engineer?
Hablemos.

30 minutos. Sin compromiso. Si veo que puedo ayudarte, te lo digo. Si no, también.

Agendar videollamada →