Data EngineeringCloud ArchitectureSistemas agénticosMachine LearningMLOpsAutor técnico
Construyo el camino completo del dato: desde la ingesta masiva de sistemas legados
hasta el agente que decide y aprende en producción. Escribí un libro sobre ese
recorrido y salió de sistemas reales, con sus errores incluidos. Además lo hago
legible: mi formación
en Diseño Gráfico convierte arquitecturas complejas en tableros que un comité entiende
en treinta segundos.
Ciudad Autónoma de Buenos Aires, Argentina · UTC-3
Migración a escala cloud. Lideré el traspaso crítico de +15 TB de datos históricos desde on-premise hacia Azure, orquestando flujos híbridos con Azure Data Factory y Apache NiFi.
Optimización de procesamiento. Pipelines ETL paralelizados en PySpark sobre Databricks: −60% en tiempos de carga para las verticales de ventas y logística.
Arquitectura de Data Lake. Diseñé un lake sobre ADLS Gen2 con particionamiento dinámico, mejorando el rendimiento de consultas analíticas y el consumo desde Power BI.
Ecosistema end-to-end. Soluciones integrales sobre Azure Data Factory, integrando transformaciones en Databricks (PySpark/Scala) y AzureML para el despliegue de modelos productivos.
DevOps y automatización. Automaticé el ciclo de vida de las aplicaciones con pipelines CI/CD en Azure DevOps, contenedores Docker y orquestación en Kubernetes.
Azure DevOpsAzureMLKubernetesDockerScala
Yambal
Data Engineer · Proyecto minero (Perú)SUCCESS2023
task_id = yambal__mining_ingestion | region=PE
Ingeniería de datos industrial. Diseñé la arquitectura de ingesta para operaciones mineras a gran escala, asegurando integridad de la información en entornos de baja conectividad.
Visualización estratégica. Tableros de control avanzados en Power BI alimentados por transformaciones en Databricks y Data Factory, para decisión en tiempo real.
Ingesta de alta performance. Arquitecturas de ingesta en tiempo real con APIs RESTful (FastAPI/Flask) e integración de OAuth2 para flujos de datos sensibles.
Escalabilidad en Kubernetes. Microservicios sobre clústeres gestionados (AKS/EKS) escalando la ingesta hasta +500K solicitudes por hora.
Latencia.−40% en tiempo de respuesta de las APIs vía caching con Redis y balanceo de carga avanzado.
Cultura DevOps. CI/CD con GitLab y despliegue multicloud (Azure/AWS): −25% en tiempos de puesta en producción.
FastAPIRedisAKS / EKSGitLab CIOAuth2
Accenture
Cloud Data EngineerSUCCESS2020 → 2022
task_id = accenture__dwh_modeling | volume=10TB
Migraciones estratégicas. Migración de +10 TB desde entornos locales a Azure con stack híbrido NiFi + Data Factory.
Orquestación cloud native. Flujos paralelizados en Apache Airflow para ingesta automatizada de APIs públicas, persistiendo en AWS S3 y MongoDB.
Arquitectura de información. Lideré el modelado de Data Warehouses, estructurando esquemas complejos para tableros usados por C-Level.
Computer vision en tiempo real. Lideré el desarrollo y despliegue de un sistema de IA con redes neuronales (TensorFlow) para detección automatizada de temperatura y uso de elementos de seguridad, con backend en Django.
Infraestructura de inferencia. Microservicios sobre AWS EC2 en contenedores Docker, con observabilidad y alertas vía Amazon CloudWatch.
Sin respuestas correctas: la tarea es hallar estructura en el caos. Segmentar clientes, agrupar comportamientos, comprimir dimensiones sin perder señal.
ClusteringK-MeansSegmentación de clientesPCAReducción de dimensionalidadDetección de anomalías
Por refuerzo
el modelo actúa
Ni etiquetas ni silencio: recompensa. El agente prueba, mide la consecuencia y ajusta su política. Es el puente entre predecir y decidir.
Política y recompensaExploración vs. explotaciónQ-LearningDeep RLShaping de recompensaAuto-evaluación
Aprendizaje profundo
la sala de máquinas
Del perceptrón a la red profunda: capas que construyen representaciones cada vez más abstractas a partir de datos crudos.
PerceptrónBackpropagationFunciones de activaciónTensorFlowPyTorchKeras
El equilibrio
sesgo · varianza
El dilema más profundo de la disciplina: aprender lo justo. El sobreajuste memoriza sin entender; el subajuste simplifica de más. Acertar es generalizar.
SobreajusteSubajusteValidación cruzadaRegularizaciónMétricas de error · SSE
Del modelo al sistema
MLOps
Un modelo que no llega a producción no existe. Empaquetado, servido, monitoreado y reentrenado con el mismo rigor que un pipeline de datos.
AzureMLSpark MLlibFastAPI · inferenciaDocker · KubernetesAirflow · reentrenamientoTelemetría y drift
Publicaciones
autor · castellano
#MACHINELEARNING
El Aprendizaje de las Máquinas
EMANUEL BAQUERO
3 partes87 páginascastellano
Una invitación, no un manual para iniciados. No presupone matemática avanzada ni una línea de código: cada concepto se ancla en una analogía cotidiana y las fórmulas siempre llegan acompañadas de su significado en palabras llanas.
P. ILos cimientos: qué significa que una máquina aprenda, con maestro y sin guía, y los modelos con los que todo empieza.
P. IIMás allá de la línea recta: árboles que preguntan, vectores que maximizan márgenes, redes que imitan al cerebro.
P. IIILa sala de máquinas: redes profundas, los caminos del aprendizaje y el cruce hacia sistemas que no solo predicen, sino que actúan.
Plataforma propietaria de procesamiento distribuido y orquestación de Machine Learning, optimizada para el ecosistema Delta Lake. Es mi banco de pruebas: todo lo que valido acá termina siendo criterio de diseño en proyectos productivos.
Motor SQL propio + interfaz de monitoreo en Flask con telemetría en vivo de tablas Delta dentro de entornos containerizados.
Copilot integrado que genera Notebooks de Databricks y DAGs de Airflow: +40% de productividad de desarrollo.
Pipeline de subtitulado automático con Whisper AI y FFmpeg embebido en DAGs de Airflow.
Data Science · Digital House verificar ↗Microsoft Certified: Azure Data EngineerDesigning Data Lakes on AWSCloudera CDP · EssentialsCloudera CDP · Machine LearningCloudera CDP · Data WarehouseCloudera CDP · Private Cloud FundamentalsMongoDB · Replica Set & Cluster Admin
Formación
técnica + visual
Maestría
Data Science
Digital House
Especialización
Data Scientist Professional
Digital House
Grado
Ingeniería en Sistemas de Información
UTN · Universidad Tecnológica Nacional
Grado
Diseño Gráfico
UBA · Universidad de Buenos Aires
¿Tenés un pipeline que no escala?
Trabajo con equipos que necesitan mover volumen, ordenar su plataforma de datos o llevar un modelo de la notebook a producción. Contame el problema.