University of Barcelona
Jaime Berdejo Sánchez
Data & AI Engineer
Barcelona, Spain
PROFILE
Computer Science graduate with a dual background in Business Administration and a Master's in AI Applied to Financial Markets, combining engineering depth with quantitative and business understanding. Hands-on experience building production ETL pipelines on AWS and developing LLM-based systems—from RAG and agentic applications to data-driven analytics platforms. I take projects from concept to production, turning complex problems into scalable, intelligent tools that deliver measurable impact.
EDUCATION
University of Granada
PROFESSIONAL EXPERIENCE
- Data Warehouse Maintenance & Integrity: Managed the division's Data Warehouse, monitoring internal databases to detect and resolve inconsistencies, and maintaining documentation that kept critical data accessible for the analytics team.
- ETL Pipeline Development: Built and optimized data pipelines in Java and Python on AWS Glue and Apache Airflow, automating data flows that improved processing efficiency and reduced manual intervention in the reporting cycle.
- Cross-Functional Collaboration: Partnered with data analysts to translate business requirements into robust technical implementations aligned with the team's data infrastructure roadmap.
- Technical Support & Web Maintenance: Resolved technical tickets for web change requests and IT operations, keeping internal tools and web platforms fully operational.
- Domain & Infrastructure Administration: Administered company domains and DNS configuration, ensuring proper record propagation and security protocols and contributing to 100% service uptime.
TECHNICAL SKILLS
Data Engineering & Cloud: AWS (Glue, S3, Lambda, EC2, EMR, IAM, SageMaker), Apache Airflow, dbt, PySpark, ETL/ELT automation, SQL (PostgreSQL, MySQL), NoSQL (MongoDB), Data Warehousing (Snowflake, Redshift, BigQuery), Schema design & optimization.
AI Engineering & GenAI: LangChain, LangGraph, Multi-agent system design, LLM integration (OpenAI, Claude, Gemini, Groq), RAG pipelines, Prompt engineering, Vector databases (pgvector).
Automation & Agentic Workflows: Python automation & scripting, n8n (low-code workflow automation), autonomous & multi-agent systems, AI agent orchestration, task scheduling (cron), webhooks & API integrations, end-to-end process automation.
Programming & Backend: Python (Advanced), Java, SQL, Bash, FastAPI, Django, REST API design, Git (GitHub/GitLab), Docker, CI/CD (GitHub Actions).
Data Science & Analytics: Pandas, NumPy, scikit-learn, XGBoost, PyTorch, Statistical modeling, Financial data analysis, Data visualization (Power BI, Tableau, Matplotlib).
LANGUAGES
Spanish: Native English: Fluent (C1 — Advanced)
SELECTED PROJECTS
FiscalPilot — Ongoing
Stack: Python, FastAPI, LangGraph, Claude API, Supabase (Postgres + pgvector), Next.js, PSD2 (GoCardless)
Agentic SaaS acting as a virtual CFO for Spanish freelancers: connects to bank accounts via PSD2, automatically reserves taxes (IVA/IRPF), classifies expenses, and proposes investment of idle cash—all under human-in-the-loop approval and full auditability (GDPR, EU AI Act, MiFID II compliant). Built on a deterministic tax engine with an agentic LangGraph layer above for reasoning.
RAG for European Financial Regulation — Master's Thesis (TFM) — Ongoing
Stack: Python, LangChain, vector databases, sentence-transformers, RAGAS, LLM APIs
Empirical study designing and evaluating Retrieval-Augmented Generation systems applied to the full hierarchy of European financial regulation (EU Regulations, RTS, ESMA Q&As, CNMV criteria). Building a modular RAG pipeline, releasing a public benchmark of validated reference Q&A pairs, and benchmarking chunking strategies, embedding models, and generator LLMs across standard retrieval metrics (Recall@k, MRR) and generation metrics (faithfulness, answer relevance) following the RAGAS framework and LegalBench-RAG methodology.
AutoVideo
Stack: Python, Typer, Claude API (Anthropic), ElevenLabs, Playwright, Jinja2, FFmpeg, WhisperX, Pydantic v2, Docker
Tool that fully automates the video-creation workflow: from a list of bullet points and a target duration, it produces a finished narrated slide video with zero manual editing. Orchestrates an end-to-end pipeline (LLM storyboard design → HTML/CSS slides rendered to PNG via Playwright → duration-calibrated voice-over script → ElevenLabs TTS or mic recording aligned with WhisperX → FFmpeg assembly with synchronized subtitles), all driven by code-defined SVG visuals (no stock or AI images). Exposes 4 automation levels (from stage-by-stage review to fully autonomous) and ships as a CLI with a dry-run cost estimator, plus a Dockerized build.
RoleRadar
Stack: Python, FastAPI, n8n, Streamlit, APScheduler, OpenAI (GPT-4o), BGE-M3 embeddings (sentence-transformers), Instructor, Pydantic v2, Docker Compose, Telegram
Autonomous job-matching radar that ingests raw postings from multiple job boards, normalizes and semantically deduplicates them, and honestly scores each one against my real profile—parsed directly from my CV PDF—via a hybrid heuristic fusing deterministic rules (role-ranking decay, seniority, location/remote, hard deal-breakers) with LLM judgment. Built around a single intelligent core shipped in two automation setups: (v1) the smart pieces run as a service while n8n handles the daily schedule, source ingestion, and digest delivery; (v2) a self-contained app that fetches, cleans, ranks, and pushes a Telegram/email digest on schedule with no human in the loop, behind a simple web UI. Scoring runs fully offline by default, with the LLM as an optional layer for written explanations—so it works end-to-end even without an API key.
FinFeed
Stack: Next.js, TypeScript, Python, Supabase, GitHub Actions, Groq (Llama 3.3 70B), OpenAI TTS, FFmpeg, faster-whisper
Autonomous multi-modal news pipeline that delivers AI-generated short-form videos twice daily across Finance and Tech categories. Engineered an end-to-end CI/CD pipeline (RSS ingestion → LLM script generation → TTS narration → animated subtitles → FFmpeg video synthesis → Supabase delivery) running in under 15 minutes with zero human intervention.
Florida Real Estate Price Prediction
Stack: Python, scikit-learn, XGBoost/LightGBM, Pandas, geospatial libraries
End-to-end ML pipeline for a Master's-level competition predicting Florida property prices on a dataset with ~60 features including JSON-nested attributes and geographic coordinates. Engineered domain-specific features (location clustering, property type encoding), benchmarked gradient boosting models, and optimized for MAE.
Jaime Berdejo Sánchez
Ingeniero de Datos e IA
Barcelona, España
PERFIL
Ingeniero Informático con doble titulación en Administración y Dirección de Empresas y un Máster en Inteligencia Artificial Aplicada a los Mercados Financieros, combinando una base técnica sólida con una visión cuantitativa y de negocio. Cuento con experiencia práctica en el desarrollo de pipelines ETL en producción sobre AWS y en sistemas basados en LLMs, desde aplicaciones agénticas y RAG hasta plataformas de analítica de datos. Llevo proyectos desde la idea hasta la producción, transformando problemas complejos en herramientas escalables e inteligentes con impacto medible.
FORMACIÓN ACADÉMICA
Universidad de Barcelona
Universidad de Granada
EXPERIENCIA PROFESIONAL
- Mantenimiento e Integridad del Data Warehouse: Gestioné el Data Warehouse de la división, monitorizando las bases de datos internas para detectar y resolver inconsistencias, y manteniendo la documentación que aseguraba el acceso a los datos críticos por parte del equipo de analítica.
- Desarrollo de Pipelines ETL: Diseñé y optimicé pipelines de datos en Java y Python sobre AWS Glue y Apache Airflow, automatizando flujos que mejoraron la eficiencia de procesamiento y redujeron la intervención manual en el ciclo de reporting.
- Colaboración Interdepartamental: Trabajé con analistas de datos para traducir requisitos de negocio en implementaciones técnicas robustas, alineadas con la hoja de ruta de la infraestructura de datos del equipo.
- Soporte Técnico y Mantenimiento Web: Resolví tickets técnicos de cambios en plataformas web y operaciones de IT, manteniendo las herramientas internas y plataformas web plenamente operativas.
- Administración de Dominios e Infraestructura: Administré los dominios de la empresa y la configuración DNS, garantizando la propagación correcta de registros y los protocolos de seguridad, contribuyendo a un 100% de uptime del servicio.
COMPETENCIAS TÉCNICAS
Ingeniería de Datos y Cloud: AWS (Glue, S3, Lambda, EC2, EMR, IAM, SageMaker), Apache Airflow, dbt, PySpark, automatización ETL/ELT, SQL (PostgreSQL, MySQL), NoSQL (MongoDB), Data Warehousing (Snowflake, Redshift, BigQuery), diseño y optimización de esquemas.
Ingeniería de IA y GenAI: LangChain, LangGraph, diseño de sistemas multi-agente, integración de LLMs (OpenAI, Claude, Gemini, Groq), pipelines RAG, prompt engineering, bases de datos vectoriales (pgvector).
Automatización y Flujos Agénticos: Automatización y scripting con Python, n8n (automatización de flujos low-code), sistemas autónomos y multi-agente, orquestación de agentes de IA, programación de tareas (cron), webhooks e integraciones de APIs, automatización de procesos de extremo a extremo.
Programación y Backend: Python (avanzado), Java, SQL, Bash, FastAPI, Django, diseño de APIs REST, Git (GitHub/GitLab), Docker, CI/CD (GitHub Actions).
Ciencia de Datos y Analítica: Pandas, NumPy, scikit-learn, XGBoost, PyTorch, modelado estadístico, análisis de datos financieros, visualización de datos (Power BI, Tableau, Matplotlib).
IDIOMAS
Español: Nativo Inglés: Avanzado (C1)
PROYECTOS DESTACADOS
FiscalPilot — En desarrollo
Stack: Python, FastAPI, LangGraph, Claude API, Supabase (Postgres + pgvector), Next.js, PSD2 (GoCardless)
SaaS agéntico que actúa como un CFO virtual para autónomos en España: se conecta a las cuentas bancarias vía PSD2, reserva automáticamente los impuestos (IVA/IRPF), clasifica los gastos y propone la inversión del efectivo ocioso, todo bajo aprobación human-in-the-loop y plena auditabilidad (cumple RGPD, EU AI Act y MiFID II). Construido sobre un motor fiscal determinista con una capa agéntica de LangGraph por encima para el razonamiento.
RAG para Regulación Financiera Europea — Trabajo Fin de Máster (TFM) — En desarrollo
Stack: Python, LangChain, bases de datos vectoriales, sentence-transformers, RAGAS, APIs de LLM
Estudio empírico que diseña y evalúa sistemas de Retrieval-Augmented Generation aplicados a la jerarquía completa de la regulación financiera europea (Reglamentos UE, RTS, Q&As de ESMA, criterios de la CNMV). Construyo un pipeline RAG modular, publico un benchmark abierto de pares pregunta-respuesta de referencia validados, y comparo estrategias de chunking, modelos de embedding y LLMs generadores sobre métricas estándar de recuperación (Recall@k, MRR) y de generación (faithfulness, answer relevance), siguiendo el framework RAGAS y la metodología LegalBench-RAG.
AutoVideo
Stack: Python, Typer, Claude API (Anthropic), ElevenLabs, Playwright, Jinja2, FFmpeg, WhisperX, Pydantic v2, Docker
Herramienta que automatiza por completo el workflow de creación de vídeos: a partir de una lista de bullet points y una duración objetivo, genera un vídeo final de slides narrado sin edición manual. Orquesta un pipeline de extremo a extremo (diseño de storyboard con LLM → slides en HTML/CSS renderizadas a PNG con Playwright → guion de voz en off calibrado a la duración → narración TTS con ElevenLabs o grabación de micro alineada con WhisperX → ensamblado con FFmpeg y subtítulos sincronizados), con visuales definidos por código mediante iconos SVG (sin imágenes de stock ni generadas por IA). Ofrece 4 niveles de automatización (desde revisión etapa por etapa hasta totalmente autónomo) y se distribuye como CLI con estimador de coste en dry-run y build dockerizado.
RoleRadar
Stack: Python, FastAPI, n8n, Streamlit, APScheduler, OpenAI (GPT-4o), embeddings BGE-M3 (sentence-transformers), Instructor, Pydantic v2, Docker Compose, Telegram
Radar autónomo de matching de empleo que ingiere ofertas en bruto de múltiples portales, las normaliza y deduplica semánticamente, y puntúa cada una de forma honesta frente a mi perfil real—extraído directamente del PDF de mi CV—mediante una heurística híbrida que fusiona reglas deterministas (decaimiento por ranking de roles, seniority, ubicación/remoto, deal-breakers excluyentes) con el juicio de un LLM. Construido en torno a un único núcleo inteligente desplegado en dos configuraciones de automatización: (v1) las piezas inteligentes corren como servicio mientras n8n gestiona la planificación diaria, la ingesta de fuentes y el envío del digest; (v2) una app autónoma que obtiene, limpia, ordena y envía un digest por Telegram/email de forma programada sin intervención humana, tras una interfaz web sencilla. La puntuación funciona totalmente offline por defecto, con el LLM como capa opcional para explicaciones escritas—de modo que funciona de extremo a extremo incluso sin una API key.
FinFeed
Stack: Next.js, TypeScript, Python, Supabase, GitHub Actions, Groq (Llama 3.3 70B), OpenAI TTS, FFmpeg, faster-whisper
Pipeline autónomo multimodal de noticias que genera y publica vídeos cortos generados por IA dos veces al día en las categorías de Finanzas y Tecnología. Diseñé un pipeline CI/CD de extremo a extremo (ingesta de RSS → generación de guion con LLM → narración TTS → subtítulos animados → síntesis de vídeo con FFmpeg → entrega en Supabase) que se ejecuta en menos de 15 minutos sin intervención humana.
Florida Real Estate Price Prediction
Stack: Python, scikit-learn, XGBoost/LightGBM, Pandas, librerías geoespaciales
Pipeline de Machine Learning de extremo a extremo para una competición a nivel de Máster de predicción de precios inmobiliarios en Florida sobre un dataset con ~60 variables, incluyendo atributos JSON anidados y coordenadas geográficas. Realicé ingeniería de variables específicas del dominio (clustering por ubicación, codificación de tipo de propiedad), comparé modelos de gradient boosting y optimicé el MAE.