Carrera en economía y finanzas

Habilidades técnicas en Python y SQL esenciales para el sector financiero: casos reales de automatización, extracción de datos y nowcasting

Economista / Analista Cuantitativo de Datos Financieros

Marco de Ciencia de Datos para Profesionales de Inversión (CFA Institute) y Prácticas de Big Data del Comité Irving Fisher (BIS)

  • Consultas avanzadas de series temporales en SQL (ASOF JOIN, time bucketing, gap filling)
  • Extracción automatizada de datos macroeconómicos mediante web scraping y APIs (FRED)
  • Procesamiento de Lenguaje Natural (NLP) aplicado a documentos de política económica
  • Modelado predictivo y nowcasting de series macroeconómicas (factores dinámicos, bridge equations)
  • Tratamiento de no-estacionariedad, heterocedasticidad y autocorrelación en series financieras
  • Visualización de datos y mitigación de sesgos en pipelines analíticos
  • Traducción y explicación de conceptos de machine learning a audiencias no técnicas
  • Rigor metodológico en la evaluación de calidad y representatividad de datos
  • Interpretación contextual de políticas económicas y decisiones de mercado
  • Python (NLTK, XGBoost, MLFinLab)
  • SQL (BigQuery, Snowflake)
  • APIs de datos financieros y macroeconómicos (FRED)
  • R
  • Data Science for Investment Professionals Certificate (CFA Institute)

I. La convergencia tecnológica en el análisis financiero y económico

Durante décadas, el análisis económico dependió casi por completo de las estadísticas oficiales publicadas por institutos nacionales y organismos multilaterales. Ese modelo funcionaba mientras la velocidad de los mercados y la de la política pública avanzaban al mismo ritmo. Ya no es así. Como señala un working paper del Comité Irving Fisher sobre Estadísticas de Bancos Centrales (BIS), la recopilación de datos oficiales exige un esfuerzo considerable y su publicación suele llegar con meses, incluso años, de retraso, mientras que en paralelo se ha producido un crecimiento explosivo del volumen de datos disponibles en tiempo real y de la tecnología para analizarlos. Ese desfase entre la frecuencia de los datos oficiales y la velocidad de decisión de mercados y bancos centrales es, precisamente, el que ha empujado a economistas y analistas cuantitativos a incorporar herramientas propias de la ingeniería de datos: SQL para gestionar series temporales a escala, y Python para automatizar la extracción, el procesamiento textual y el modelado predictivo.

El resultado es un perfil híbrido que ya no se limita a interpretar boletines estadísticos, sino que construye sus propios pipelines de datos, entrena modelos de nowcasting y audita el sesgo de sus propias predicciones. Este perfil comparte más terreno con la ingeniería de software del que solía admitirse: quien quiera entender de dónde vienen estas prácticas de automatización y extracción de datos puede revisar primero qué hace un desarrollador backend, ya que buena parte de la lógica de pipelines, APIs y bases de datos que hoy manejan los economistas cuantitativos proviene directamente de esa disciplina.

II. SQL para finanzas: gestión y alineación de series temporales

A. ASOF JOIN: resolver el desfase temporal entre fuentes

Uno de los problemas más recurrentes en el análisis financiero es cruzar dos series de datos que no comparten exactamente las mismas marcas de tiempo: una cotización que se registra al segundo con un indicador macroeconómico que se publica una vez al mes, o dos flujos de datos de mercado con relojes ligeramente distintos. Snowflake resolvió este problema de forma nativa con la incorporación, en general disponibility desde mayo de 2024, del ASOF JOIN, un tipo de unión que empareja registros según el valor de tiempo precedente o coincidente más cercano, en lugar de exigir una igualdad exacta entre marcas temporales. A diferencia de un join tradicional, el ASOF JOIN admite condiciones de comparación de desigualdad (mayor o igual, menor o igual, mayor, menor) pero no de igualdad, y su cardinalidad de salida es siempre igual a la de la tabla de la izquierda, de forma similar a un left join.

Sus casos de uso documentados son directamente relevantes para el analista financiero: análisis de series temporales en datos de mercado o flujos de IoT, relleno de datos faltantes uniendo con el registro precedente más reciente —particularmente útil al preparar variables para modelos de machine learning— y seguimiento de eventos que ocurren más cerca de un punto temporal de referencia en otra tabla. Antes de esta sintaxis nativa, estas operaciones se emulaban con combinaciones complejas de joins y funciones de ventana; el ASOF JOIN simplifica y, en la práctica, optimiza consultas que antes requerían decenas de líneas adicionales.

B. Time bucketing y gap filling en almacenes analíticos

Google Cloud introdujo en BigQuery un conjunto de funciones de SQL diseñadas explícitamente para simplificar dos operaciones habituales del análisis de series temporales: el agrupamiento en ventanas (time bucketing) y el relleno de vacíos (gap filling). Las funciones de bucketing temporal permiten asignar cada punto de datos, muestreado en momentos arbitrarios, a una ventana de salida de duración y alineación específicas —por ejemplo, promediar un valor cada diez minutos durante las últimas doce horas—, mientras que la función de tabla GAP_FILL aborda los huecos que deja la falta de datos, ya sea porque un servidor se reinicia, porque no hay actividad de mercado en cierta franja horaria o porque los datos son intrínsecamente dispersos. GAP_FILL admite tres modos de relleno: mantener el último valor observado (locf), interpolación lineal, o insertar valores nulos explícitos. A esto se suma el tipo de dato RANGE, pensado para representar ventanas continuas de tiempo y registrar el estado temporal de un valor.

El objetivo declarado de Google Cloud al introducir estas funciones es evitar que las organizaciones tengan que construir pipelines separados que primero limpien y normalicen los datos de series temporales en un almacén específico antes de exportarlos al data warehouse general, un patrón que ralentiza el tiempo hasta obtener información útil y termina generando silos de datos. Con estas funciones, un economista puede analizar sus series temporales —tipos de interés, inflación, spreads de crédito— junto al resto de los datos de negocio, sin renunciar a la sintaxis SQL estándar que ya domina.

C. Pipelines de datos unificados para análisis financiero y contable

La combinación de ASOF JOIN, time bucketing y gap filling permite construir pipelines donde datos contables internos, cotizaciones de mercado y series macroeconómicas oficiales conviven en las mismas tablas analíticas, alineados temporalmente sin necesidad de scripts externos de limpieza. Para un equipo de finanzas corporativas esto se traduce en cierres contables automatizados que concilian transacciones con tipos de cambio o tasas de referencia vigentes en el momento exacto de cada operación, y en reportes de tesorería que se recalculan automáticamente cuando llega un nuevo dato, sin intervención manual. Quienes deseen profundizar en cómo se comparan los distintos motores SQL y lenguajes que sustentan estos pipelines pueden revisar la comparativa de lenguajes de programación backend más utilizados, útil para decidir qué stack tecnológico acompaña mejor a SQL en un entorno financiero.

III. Python para extracción automatizada y procesamiento textual

A. Ingesta automatizada de fuentes macroeconómicas y financieras

Un ejemplo público y documentado de este tipo de pipeline es el proyecto de análisis de comunicación de bancos centrales conocido como FedSpeak, que construye un flujo completo de scraping y procesamiento en Python. El proyecto extrae de forma automatizada, mediante scripts propios, comunicados, minutas, transcripciones de ruedas de prensa, discursos y testimonios publicados en el sitio del Comité Federal de Mercado Abierto (FOMC), y en paralelo descarga desde la API de FRED (Federal Reserve Economic Data) series como la tasa de fondos federales, el PIB real y potencial, el PCE subyacente, el IPC, la tasa de desempleo, el empleo no agrícola, las ventas minoristas, la venta de vivienda nueva y los índices PMI de manufactura y servicios del ISM. A este conjunto se suma el diccionario de sentimiento Loughran-McDonald, diseñado específicamente para textos financieros, y vectores de palabras GloVe para representación semántica.

Este tipo de arquitectura —scraping estructurado más ingestión de series desde una API pública, unificados en un mismo pipeline de Python— es hoy una competencia de entrada para cualquier analista cuantitativo que necesite anticiparse a la publicación oficial de indicadores, en lugar de esperar pasivamente a que estos se publiquen con semanas o meses de retraso.

B. NLP aplicado a la comunicación de bancos centrales

El propósito final del pipeline FedSpeak no es solo acumular texto, sino convertirlo en señal predictiva: el proyecto entrena modelos de aprendizaje automático, entre ellos XGBoost, sobre representaciones textuales procesadas con NLTK, con el objetivo de anticipar cambios en la política monetaria a partir del lenguaje empleado por la Reserva Federal. Esta línea de trabajo encaja directamente con uno de los cinco cursos que componen el Data Science for Investment Professionals Certificate del CFA Institute, que dedica un módulo completo al procesamiento de lenguaje natural aplicado a la toma de decisiones de inversión, junto con módulos de estadística para machine learning, aplicaciones de machine learning a problemas de inversión y mitigación de sesgos en el pipeline de datos.

Según el propio CFA Institute, el certificado —cien horas de contenido interactivo entre video, laboratorios de código y casos de estudio de la industria, sin requisito previo de conocimientos de ciencia de datos— responde a una brecha de habilidades muy concreta: en una encuesta previa de la organización, el 64% de los profesionales de inversión declaró interés en aprender más sobre inteligencia artificial y machine learning, pero solo el 3% se consideraba ya competente en esos conceptos. Richard Fernand, responsable de gestión de certificaciones del CFA Institute, resume el objetivo del programa como dotar a los profesionales del lenguaje necesario para explicar y traducir conceptos de machine learning a problemas reales de inversión, no solo de la capacidad técnica de ejecutarlos.

IV. Modelado predictivo, nowcasting y machine learning financiero

A. Nowcasting macroeconómico: descomposición por subcomponentes y factores dinámicos

El caso más citado de nowcasting institucional es GDPNow, el modelo de estimación en tiempo real del crecimiento del PIB estadounidense publicado por la Reserva Federal de Atlanta. Su lógica es reveladora de cómo se diseña un modelo predictivo serio en macroeconomía: en lugar de pronosticar el PIB de forma directa, GDPNow descompone el indicador en las trece subcomponentes que la Oficina de Análisis Económico (BEA) utiliza para construir su estimación «avanzada» —consumo de bienes y servicios, inversión residencial, inversión no residencial en equipo, propiedad intelectual y estructuras, variación de inventarios privados, gasto público federal y estatal-local, y exportaciones e importaciones de bienes y servicios— y luego agrega esos pronósticos con la misma fórmula de encadenamiento de Fisher que emplea la propia BEA.

Metodológicamente, el modelo sintetiza dos tradiciones econométricas: el enfoque de bridge equations, originado en los trabajos de Lawrence Klein y de Miller y Chin, y el enfoque de modelos de factores dinámicos propuesto por Giannone, Reichlin y Small en 2008. En la práctica, ejecuta un proceso de ocho pasos que combina alrededor de 125 series mensuales, un BVAR de precios de 34 variables y varios BVAR por bloques, y se reestima entre seis y siete veces al mes, cada vez que se publica un dato relevante. La razón de ser de todo este aparato es puramente de latencia: aproximadamente el 70% de los datos que la BEA usa para su estimación avanzada del PIB ya son públicos antes de que esa estimación se publique —ventas minoristas, balanza comercial, gasto en construcción, PMI del ISM, pedidos de bienes duraderos, ingreso y gasto personal—, y el modelo simplemente formaliza econométricamente lo que, según investigación de Faust y Wright (2009), el personal técnico de la propia Reserva Federal llevaba décadas haciendo de forma informal y basada en juicio experto.

B. No-estacionariedad, heterocedasticidad, autocorrelación y sobreajuste

Ningún modelo predictivo financiero sobrevive al contacto con datos reales si ignora las propiedades estadísticas propias de las series de mercado. La literatura reunida en torno al libro Advances in Financial Machine Learning, de Marcos López de Prado, y sistematizada en la librería de Python MLFinLab, identifica cuatro obstáculos recurrentes: el sobreajuste, derivado de la enorme cantidad de variables candidatas de las que es difícil discernir cuáles son verdaderamente predictivas; la no-estacionariedad, que invalida los supuestos de técnicas como la regresión lineal clásica al cambiar las propiedades estadísticas de la serie en el tiempo; la heterocedasticidad, que dificulta estimar correctamente la varianza y sesga los parámetros del modelo; y la autocorrelación, que rompe el supuesto de independencia entre observaciones sobre el que se apoyan buena parte de los métodos estadísticos tradicionales.

Frente a estos problemas, la misma literatura propone soluciones concretas y hoy ampliamente adoptadas en la industria: sustituir las barras de tiempo tradicionales por barras de dólar, que agrupan las transacciones según un monto fijo negociado en lugar de un intervalo temporal fijo, reduciendo ruido; aplicar diferenciación fraccionaria para transformar series no estacionarias en estacionarias sin eliminar por completo la memoria de la serie; usar un filtro CUSUM simétrico para detectar puntos de inflexión relevantes en la tendencia; y emplear el etiquetado de triple barrera para definir de forma sistemática umbrales de toma de beneficios, stop-loss y ausencia de operación en función de la volatilidad del activo.

C. Regularización y mitigación de sesgos en el pipeline de datos

La mitigación de sesgos no es un paso opcional al final del proceso, sino que el propio temario del CFA Institute la trata como un módulo independiente y final del certificado de ciencia de datos, precisamente porque llega después de que el analista ya sabe aplicar machine learning a problemas de inversión: primero se aprende a construir el modelo, después se aprende a auditar si ese modelo introduce sesgos sistemáticos en la evaluación de riesgo o en la asignación de capital. Esa misma preocupación aparece, a escala institucional, en la encuesta del Comité Irving Fisher del BIS, que identifica la equidad algorítmica y la calidad y representatividad de los datos entre los principales desafíos que enfrentan los bancos centrales al adoptar big data.

V. Adopción institucional, infraestructura y competencias clave

A. Big data y machine learning en banca central

La encuesta del Comité Irving Fisher del Banco de Pagos Internacionales, realizada entre 52 bancos centrales de todas las regiones del mundo, documenta una aceleración notable: alrededor del 80% de las instituciones encuestadas discute formalmente el tema del big data dentro de su organización, frente a apenas el 30% que lo hacía en 2015. La gran mayoría de los bancos centrales ya ejecuta proyectos concretos que involucran big data y machine learning en cuatro frentes: investigación económica, estabilidad financiera, política monetaria y aplicaciones de suptech y regtech (tecnología aplicada a supervisión y regulación). El mismo informe advierte que los principales obstáculos no son tecnológicos sino organizativos: calidad y representatividad de los datos, incertidumbre legal en torno a la privacidad, equidad algorítmica y confidencialidad, y restricciones presupuestarias para construir la infraestructura de TI y el capital humano necesarios. La conclusión del BIS es explícita: la cooperación entre autoridades públicas podría aliviar buena parte de estas restricciones de recolección, almacenamiento y análisis de datos.

B. Brecha de habilidades y estándares formativos

El diagnóstico del sector privado converge con el del sector público. La misma encuesta que impulsó al CFA Institute a lanzar su certificado de ciencia de datos muestra una brecha muy concreta entre interés y competencia real: mayoritario interés declarado en aprender inteligencia artificial y machine learning, pero una fracción mínima de profesionales que se considera ya capacitada. Cerrar esa brecha exige, en la práctica, una combinación de habilidades técnicas —SQL para series temporales, Python para extracción y modelado, R para visualización— y habilidades blandas específicas del sector: capacidad de explicar un modelo de machine learning a un comité de inversión sin formación técnica, rigor para evaluar si una fuente de datos es representativa antes de construir un modelo sobre ella, y criterio para interpretar una decisión de política monetaria en el contexto más amplio del ciclo económico.

Para las organizaciones que necesitan formar internamente a economistas y analistas en estas competencias, los principios no difieren tanto de los que rigen la incorporación de cualquier otro perfil técnico: conviene revisar cómo diseñar un proceso de onboarding técnico eficaz para asegurar que estas habilidades se transfieran de forma estructurada y no dependan únicamente de la iniciativa individual. Y para quienes buscan posicionarse en el mercado laboral con este perfil híbrido, aplicar los mismos estándares que se exigen a un ingeniero de software a la hora de documentar proyectos y resultados cuantitativos —tal como se explica en la guía sobre cómo redactar un currículum técnico para perfiles de ingeniería de software— puede marcar la diferencia frente a un mercado donde, según el propio CFA Institute, la demanda de estas competencias crece más rápido que la oferta de profesionales certificados para cubrirla.

Fuentes Oficiales y Referencias Consultadas