Sr. Data Engineer · Buenos Aires

Emanuel
Baquero Nicolás

Data Engineering Cloud Architecture Sistemas agénticos Machine Learning MLOps Autor técnico

Construyo el camino completo del dato: desde la ingesta masiva de sistemas legados hasta el agente que decide y aprende en producción. Escribí un libro sobre ese recorrido y salió de sistemas reales, con sus errores incluidos. Además lo hago legible: mi formación en Diseño Gráfico convierte arquitecturas complejas en tableros que un comité entiende en treinta segundos.

Ciudad Autónoma de Buenos Aires, Argentina · UTC-3
~/emanuelbaquero — zsh — 80×24

    
En producción
0
desde 2018
Migrado a cloud
0
on-prem → Azure
Carga sostenida
0
requests / hora
Reducción ETL
0
tiempos de carga
Organizaciones
0
AR · PE · multinacional
Certificaciones
0
con link verificable
Libro publicado
0
machine learning aplicado
Páginas escritas
0
3 partes · castellano

Stack técnico

herramientas en uso productivo

Cloud & Big Data

core

# donde vive el volumen

Azure DatabricksAzure Data Factory PySparkSpark / Scala ADLS Gen2Delta Lake SnowflakeHadoop · HDFS · Hive AWS S3 · EC2 · EKSAzureML CloudWatchCloudera CDP

Lenguajes & Datos

daily

# de la query al modelo

PythonSQL PL/SQLT-SQL Shell ScriptingPandas · NumPy Scikit-learnVaex · Dask OracleSQL Server PostgreSQLMongoDB RedisScala

Orquestación & DevOps

infra

# que corra solo, todos los días

Apache AirflowDocker Kubernetes · AKS/EKSApache NiFi KafkaAzure DevOps GitLab CI/CDTerraform HelmDocker Swarm Git · GitHubLinux · Ubuntu/CentOS

IA, Backend & Visual

applied

# el modelo servido y explicado

TensorFlowPyTorch KerasSpark MLlib Aprendizaje por refuerzoAgentes / POA OpenAI APIDeepSeek · Llama 3 FastAPIFlask · REST DjangoOAuth2 Power BIChart.js Elastic · ELKWhisper AI · FFmpeg

Trayectoria

graph view · 2018 → hoy

Quilmes

Sr. Data Engineer RUNNING ene 2025 → hoy
task_id = quilmes__cloud_migration_las  |  retries=0  |  sla=met
  • Migración a escala cloud. Lideré el traspaso crítico de +15 TB de datos históricos desde on-premise hacia Azure, orquestando flujos híbridos con Azure Data Factory y Apache NiFi.
  • Optimización de procesamiento. Pipelines ETL paralelizados en PySpark sobre Databricks: −60% en tiempos de carga para las verticales de ventas y logística.
  • Arquitectura de Data Lake. Diseñé un lake sobre ADLS Gen2 con particionamiento dinámico, mejorando el rendimiento de consultas analíticas y el consumo desde Power BI.
DatabricksPySparkADF NiFiADLS Gen2Power BI

Pi Consulting

Sr. Data Engineer SUCCESS 2022 → 2024
task_id = pi_consulting__end_to_end_azure  |  duration=2y
  • Ecosistema end-to-end. Soluciones integrales sobre Azure Data Factory, integrando transformaciones en Databricks (PySpark/Scala) y AzureML para el despliegue de modelos productivos.
  • DevOps y automatización. Automaticé el ciclo de vida de las aplicaciones con pipelines CI/CD en Azure DevOps, contenedores Docker y orquestación en Kubernetes.
Azure DevOpsAzureMLKubernetes DockerScala

Yambal

Data Engineer · Proyecto minero (Perú) SUCCESS 2023
task_id = yambal__mining_ingestion  |  region=PE
  • Ingeniería de datos industrial. Diseñé la arquitectura de ingesta para operaciones mineras a gran escala, asegurando integridad de la información en entornos de baja conectividad.
  • Visualización estratégica. Tableros de control avanzados en Power BI alimentados por transformaciones en Databricks y Data Factory, para decisión en tiempo real.
Power BIDatabricksADF

Telefónica

Cloud Data Engineer SUCCESS 2021 → 2023
task_id = telefonica__realtime_ingestion_api  |  throughput=500K/h
  • Ingesta de alta performance. Arquitecturas de ingesta en tiempo real con APIs RESTful (FastAPI/Flask) e integración de OAuth2 para flujos de datos sensibles.
  • Escalabilidad en Kubernetes. Microservicios sobre clústeres gestionados (AKS/EKS) escalando la ingesta hasta +500K solicitudes por hora.
  • Latencia. −40% en tiempo de respuesta de las APIs vía caching con Redis y balanceo de carga avanzado.
  • Cultura DevOps. CI/CD con GitLab y despliegue multicloud (Azure/AWS): −25% en tiempos de puesta en producción.
FastAPIRedisAKS / EKS GitLab CIOAuth2

Accenture

Cloud Data Engineer SUCCESS 2020 → 2022
task_id = accenture__dwh_modeling  |  volume=10TB
  • Migraciones estratégicas. Migración de +10 TB desde entornos locales a Azure con stack híbrido NiFi + Data Factory.
  • Orquestación cloud native. Flujos paralelizados en Apache Airflow para ingesta automatizada de APIs públicas, persistiendo en AWS S3 y MongoDB.
  • Arquitectura de información. Lideré el modelado de Data Warehouses, estructurando esquemas complejos para tableros usados por C-Level.
AirflowAWS S3MongoDB NiFiData Warehousing

Cognition BI

Data Scientist & Engineer SUCCESS 2020 → 2022
task_id = cognition__computer_vision_rt  |  model=cnn
  • Computer vision en tiempo real. Lideré el desarrollo y despliegue de un sistema de IA con redes neuronales (TensorFlow) para detección automatizada de temperatura y uso de elementos de seguridad, con backend en Django.
  • Infraestructura de inferencia. Microservicios sobre AWS EC2 en contenedores Docker, con observabilidad y alertas vía Amazon CloudWatch.
TensorFlowDjangoAWS EC2 CloudWatchDocker

BP4 / Open Solutions

Desarrollador ETL SUCCESS 2018 → 2020
task_id = bp4__legacy_etl_reengineering  |  upstream=root
  • Automatización de ingesta. Scripts complejos en Shell Scripting y PL/SQL para cargas masivas sobre motores Oracle.
  • Optimización de performance. Re-ingeniería de procesos ETL legados: −45% en tiempos de ejecución y mejor consistencia de los datos productivos.
OraclePL/SQLShell Scripting Forms & Reports

Perfil técnico

autoevaluación por dominio

Cobertura de dominio

autoevaluación

Sistemas agénticos

marco propio · Programación Orientada a Agentes

Anatomía de un agente

ciclo percepción → acción

# un objeto ejecuta; un agente evalúa y puede negarse

Meta-agente SUPERVISA · VETA · AJUSTA veto Percepción SENSORES · FEATURES Estado MEMORIA · CONTEXTO Política DECIDE BAJO INCERTIDUMBRE Acción REVERSIBLE · LIMITADA Entorno NO DETERMINISTA observaciones Aprendizaje REFUERZO · AUTO-EVALUACIÓN actualiza π recompensa · resultado observado

Principios de diseño

POA
  1. El agente, no el objetoEstado, percepción, política, acción y, opcionalmente, capacidad de aprender.
  2. Mensaje y contratoDel método invocado al mensaje negociado: el receptor puede evaluar y rechazar.
  3. Aprendizaje de primera claseNo es un parche externo al sistema: es un órgano del núcleo del agente.
  4. Autonomía graduadaLa supervisión se escala según el desempeño; la autonomía se conquista, no se otorga.
  5. Infraestructura como arquitecturaAislamiento, persistencia y comunicación son parte del diseño, no del deploy.
  6. Seguridad y alineaciónToda acción reversible o limitada; el objetivo medido debe ser el objetivo real.

Mapa del aprendizaje automático

modelos que documento y aplico

Supervisado

con maestro

Datos etiquetados: el modelo aprende comparándose con la verdad conocida. Regresión si la respuesta es un número, clasificación si es una categoría.

Regresión linealLineal múltiple Regresión logísticaK vecinos (KNN) Árboles de decisiónSVM Naive BayesRandom Forest Boosting · XGBoostRedes neuronales

No supervisado

sin guía

Sin respuestas correctas: la tarea es hallar estructura en el caos. Segmentar clientes, agrupar comportamientos, comprimir dimensiones sin perder señal.

ClusteringK-Means Segmentación de clientesPCA Reducción de dimensionalidadDetección de anomalías

Por refuerzo

el modelo actúa

Ni etiquetas ni silencio: recompensa. El agente prueba, mide la consecuencia y ajusta su política. Es el puente entre predecir y decidir.

Política y recompensaExploración vs. explotación Q-LearningDeep RL Shaping de recompensaAuto-evaluación

Aprendizaje profundo

la sala de máquinas

Del perceptrón a la red profunda: capas que construyen representaciones cada vez más abstractas a partir de datos crudos.

PerceptrónBackpropagation Funciones de activaciónTensorFlow PyTorchKeras

El equilibrio

sesgo · varianza

El dilema más profundo de la disciplina: aprender lo justo. El sobreajuste memoriza sin entender; el subajuste simplifica de más. Acertar es generalizar.

SobreajusteSubajuste Validación cruzadaRegularización Métricas de error · SSE

Del modelo al sistema

MLOps

Un modelo que no llega a producción no existe. Empaquetado, servido, monitoreado y reentrenado con el mismo rigor que un pipeline de datos.

AzureMLSpark MLlib FastAPI · inferenciaDocker · Kubernetes Airflow · reentrenamientoTelemetría y drift

Publicaciones

autor · castellano
#MACHINELEARNING
El Aprendizaje de las Máquinas
EMANUEL BAQUERO
3 partes87 páginascastellano

Una invitación, no un manual para iniciados. No presupone matemática avanzada ni una línea de código: cada concepto se ancla en una analogía cotidiana y las fórmulas siempre llegan acompañadas de su significado en palabras llanas.

  • P. ILos cimientos: qué significa que una máquina aprenda, con maestro y sin guía, y los modelos con los que todo empieza.
  • P. IIMás allá de la línea recta: árboles que preguntan, vectores que maximizan márgenes, redes que imitan al cerebro.
  • P. IIILa sala de máquinas: redes profundas, los caminos del aprendizaje y el cruce hacia sistemas que no solo predicen, sino que actúan.

Proyecto propio

fuera del horario de oficina

DeltaFlow Platform

2025 → hoy · platform architect & lead developer

Plataforma propietaria de procesamiento distribuido y orquestación de Machine Learning, optimizada para el ecosistema Delta Lake. Es mi banco de pruebas: todo lo que valido acá termina siendo criterio de diseño en proyectos productivos.

  • Motor SQL propio + interfaz de monitoreo en Flask con telemetría en vivo de tablas Delta dentro de entornos containerizados.
  • Copilot integrado que genera Notebooks de Databricks y DAGs de Airflow: +40% de productividad de desarrollo.
  • Pipeline de subtitulado automático con Whisper AI y FFmpeg embebido en DAGs de Airflow.
PythonPySparkAirflow DockerFlaskOpenAI API DeepSeek / Llama 3

Certificaciones

click para verificar cada una

Vendor & academia

acreditado

Cloud, plataforma y datos

Data Science · Digital House verificar ↗ Microsoft Certified: Azure Data Engineer Designing Data Lakes on AWS Cloudera CDP · Essentials Cloudera CDP · Machine Learning Cloudera CDP · Data Warehouse Cloudera CDP · Private Cloud Fundamentals MongoDB · Replica Set & Cluster Admin

Formación

técnica + visual
Maestría

Data Science

Digital House
Especialización

Data Scientist Professional

Digital House
Grado

Ingeniería en Sistemas de Información

UTN · Universidad Tecnológica Nacional
Grado

Diseño Gráfico

UBA · Universidad de Buenos Aires

¿Tenés un pipeline que no escala?

Trabajo con equipos que necesitan mover volumen, ordenar su plataforma de datos o llevar un modelo de la notebook a producción. Contame el problema.