Currículum y carta de presentación

Cómo optimizar un currículum para superar los filtros de sistemas ATS

Director de Recursos Humanos / Profesional de Recursos Humanos

Guías de Formato Harvard FAS y Taxonomías de Parseo Textkernel/Sovren

  • Human Resource Information Systems (HRIS)
  • Benefits & Compensation
  • Labor & Union Negotiations
  • Job Analysis
  • Performance Management
  • Talent Acquisition
  • Employee Communications
  • Employee Relations
  • Leadership Development
  • Organizational Development
  • Applicant Tracking System (ATS)
  • HRIS
  • Microsoft Word
  • Adobe Acrobat Reader
  • Certificaciones Profesionales en Recursos Humanos (Licenses & Certifications)

Antes de que un reclutador humano lea una sola línea de un currículum, ese documento ya ha sido interceptado, descompuesto y reconstruido por un software. Los sistemas de seguimiento de candidatos —Applicant Tracking Systems, o ATS— actúan como una capa de filtrado algorítmico entre el candidato y la persona que decide a quién entrevistar. Entender su funcionamiento técnico, no solo intuirlo, es lo que separa un currículum que llega a un ser humano de uno que se pierde en una base de datos.

I. Introducción a los sistemas ATS (Applicant Tracking Systems)

A. El pipeline de procesamiento técnico de un parser

Todo motor de análisis de currículums, ya sea el que corre internamente en Workday o Greenhouse o el que licencian proveedores especializados como Textkernel o Sovren, ejecuta un pipeline de cinco etapas: extracción de texto, tokenización, segmentación en secciones, reconocimiento de entidades nombradas (NER) y generación de una salida estructurada. Cada etapa depende del éxito de la anterior, y un fallo en cualquiera de ellas se propaga en cascada [11].

  • Extracción de texto: el sistema lee los bytes en bruto del archivo (PDF, DOCX, RTF, HTML) y produce un flujo lineal de caracteres. En archivos DOCX, que internamente son XML, la extracción es prácticamente sin pérdidas; en PDF, depende de si el documento tiene una capa de texto nativa o si requiere una pasada de reconocimiento óptico de caracteres (OCR) [11].
  • Tokenización: el texto se divide en palabras, números y símbolos. Iconos insertados como glifos Unicode, guiones largos usados como viñetas o codificaciones mixtas generan tokens fantasma que confunden las etapas siguientes [11].
  • Segmentación en secciones: cada línea se clasifica como encabezado, resumen, experiencia, educación, habilidades o certificaciones, combinando búsquedas por expresiones regulares con clasificadores entrenados [11].
  • Reconocimiento de entidades (NER): se etiquetan tokens individuales como PERSONA, ORGANIZACIÓN, FECHA, CARGO o HABILIDAD. Los campos de contacto (correo, teléfono) alcanzan más del 99% de precisión por su naturaleza determinista, mientras que el resto de entidades, al depender de modelos entrenados, se mueve en un rango de 70% a 90% [11].
  • Salida estructurada: el sistema ensambla las entidades en un esquema JSON con objetos anidados para cada empleo, título académico y habilidad, que alimenta directamente la base de datos del ATS y el autocompletado del formulario de aplicación [11][9].

La precisión compuesta de este pipeline no es trivial: cinco etapas con un 95% de exactitud cada una producen apenas un 77% de exactitud de extremo a extremo. Estudios recientes sitúan la precisión de campo de los parsers modernos en torno al 87%, frente a cerca de un 96% en revisores humanos, lo que implica que aproximadamente uno de cada ocho campos se pierde incluso en un documento limpio [11]. Investigación reciente en sistemas de extracción a escala industrial confirma que la heterogeneidad extrema de diseños y contenidos —currículums con información incrustada en imágenes o formatos de columnas complejas— es uno de los tres grandes retos que enfrentan estos motores, junto al costo computacional de los modelos de lenguaje y la falta de conjuntos de datos estandarizados para evaluarlos [12].

B. Por qué los formatos visuales complejos provocan fallos de lectura

El motor de extracción lee de izquierda a derecha y de arriba abajo a lo largo de toda la página. Cuando un currículum usa dos columnas, el parser entreteje ambas en un único flujo de texto, produciendo una secuencia ilegible donde una línea de la columna izquierda se mezcla con una de la columna derecha [11][12]. Lo mismo ocurre con tablas, cuadros de texto y elementos gráficos: rompen el orden de lectura secuencial que el algoritmo asume por defecto.

Las cifras lo confirman: un currículum en DOCX de una sola columna tiene una tasa de fallo de parseo cercana al 4%, mientras que un DOCX con tablas la eleva hasta un 31% (EDLIGO, 2025, citado en [13]). Si además el archivo es una imagen o un PDF escaneado, se activa una pasada de OCR cuya precisión a nivel de carácter (aproximadamente 98%) se degrada hasta cerca de un 85% a nivel de campo una vez que el resultado atraviesa el resto del pipeline; por eso los currículums escaneados deben evitarse en cualquier proceso mediado por ATS [11]. Un análisis reciente atribuye alrededor del 23% de los rechazos tempranos en procesos ATS a errores de parseo, una cifra coherente con esta matemática de fallos compuestos [11].

II. Formato y Maquetación Óptimos para ATS

A. Formatos de archivo admitidos y detección de documentos corruptos

Los motores de parseo comerciales, como el de Textkernel, aceptan prácticamente cualquier formato profesional de currículum: Microsoft Word en todas sus versiones (incluido DOCX), PDF, HTML, RTF, OpenOffice 2.+, Microsoft Office HTML y hojas de cálculo en texto [9]. Sovren, el motor que impulsa numerosos ATS empresariales, ofrece soporte equivalente e incluye detección automática de idioma y de configuración regional, con cobertura explícita del español y sus variantes —incluidos catalán, gallego y euskera—, lo que resulta especialmente relevante para el mercado hispanohablante [4].

Un problema frecuente y subestimado es el de los PDF corruptos: archivos que se ven perfectos visualmente pero cuya estructura interna está dañada, lo que produce resultados de parseo deficientes. La forma recomendada de diagnosticarlo es abrir el archivo con Adobe Acrobat Reader, usar la función "Guardar como texto" y revisar el resultado en un editor de texto plano; si el contenido aparece desordenado o incompleto, el PDF es la causa del problema, no el parser [4]. Por esta razón, cuando exista la opción, el formato DOCX suele ser más seguro que el PDF, ya que al ser XML nativo su extracción es prácticamente sin pérdidas [11].

B. Estructura de columna única vs. columnas múltiples y tablas

El formato de referencia distribuido por el centro de carreras de la Facultad de Artes y Ciencias de Harvard (Harvard FAS) se basa en una estructura de columna única, sin tablas ni cuadros de texto, precisamente porque ese diseño evita el problema de reordenamiento de lectura descrito antes [13]. Esta recomendación no es solo estética: como se detalló en la sección anterior, la diferencia entre un DOCX de columna única (4% de fallo de parseo) y uno con tablas (31%) es sustancial [13].

Las columnas múltiples, tan comunes en plantillas visualmente atractivas descargadas de plantillas de diseño gráfico, son una de las causas más frecuentes de que "el ATS se coma el currículum": la experiencia laboral de la columna derecha puede terminar intercalada, línea por línea, con la formación académica de la columna izquierda, generando un registro estructurado sin sentido [11].

C. Tipografías estándar, márgenes y eliminación de elementos gráficos no procesables

La especificación del formato Harvard establece tipografías serif estándar como Times New Roman en cuerpo de 10 a 12 puntos, márgenes de una pulgada y una extensión de una página para quienes tienen menos de diez a quince años de experiencia [13]. La guía oficial de Harvard FAS añade una lista explícita de elementos a evitar: pronombres personales, abreviaturas, estilo narrativo, coloquialismos, fotografías, mención de edad o género, listas de referencias y líneas que comiencen con una fecha [2][10].

En el lado positivo, la misma guía recomienda mantener consistencia de formato y contenido, equilibrar el espacio en blanco, usar de forma uniforme cursivas, negritas y mayúsculas para dar énfasis, y verificar que el diseño se conserve correctamente al convertir el archivo a PDF [2][10]. Los gráficos, iconos, barras de progreso de habilidades y cualquier elemento no textual deben eliminarse: no aportan valor semántico al parser y, en el peor de los casos, generan tokens fantasma que distorsionan la tokenización [11].

III. Estructura y Nomenclatura de Secciones

A. Uso de encabezados universales frente a etiquetas creativas

La etapa de segmentación del parser depende en gran medida de reconocer encabezados estándar como "Experiencia", "Educación" o "Habilidades" mediante expresiones regulares. Títulos creativos como "Mi trayectoria" o "Career Journey" se clasifican mal con regularidad, porque el sistema recurre a un clasificador entrenado con menor precisión para etiquetas no convencionales [11]. La recomendación práctica es simple: usar siempre la nomenclatura más genérica y reconocible posible, aunque parezca menos original.

B. Secciones predeterminadas de extracción

Los motores de parseo comerciales están calibrados para extraer un conjunto fijo de secciones por defecto. En el caso de Textkernel, estas incluyen: Datos de Contacto, Objetivo, Historial de Posiciones (con empleador, fechas, descripciones), Educación, Licencias y Certificaciones, Habilidades (con meses de uso y última fecha de uso), Idiomas, Información Personal, Formación, Logros, Asociaciones, Referencias y Aficiones [1]. Otras secciones, como patentes, publicaciones o ponencias, solo se procesan si el cliente del ATS las habilita explícitamente, y su fiabilidad es limitada [1].

Además, el sistema normaliza campos clave como nombre de institución educativa, tipo de título, nombre del empleador, cargo, habilidades, número de teléfono, promedio académico, nombre de región y código de país [9]. Esto significa que un currículum bien estructurado, con estas secciones claramente delimitadas y bajo encabezados estándar, tiene muchas más probabilidades de que cada dato caiga en el campo correcto de la base de datos del reclutador. Para perfiles técnicos, esta misma lógica de estructura aplica con matices propios que se abordan en detalle en la guía sobre cómo redactar un currículum técnico para perfiles de ingeniería de software.

C. Formato cronológico inverso y estandarización de fechas

La guía de Harvard FAS es explícita: dentro de cada sección, la información debe listarse en orden cronológico inverso, comenzando por lo más reciente, y deben evitarse los vacíos temporales como un verano sin actividad registrada [2][10]. También advierte contra un error de formato frecuente: iniciar cada línea con una fecha, lo que puede confundir tanto a un lector humano como a la extracción de entidades del parser [2][10].

Un aspecto técnico menos conocido, pero crítico según la documentación de Textkernel, es que el algoritmo no puede determinar por sí mismo cuándo fue redactado o enviado un currículum; esa fecha —llamada "fecha de última modificación del documento"— debe declararse explícitamente en la transacción de parseo, porque condiciona directamente cómo el sistema interpreta términos como "actual" o "en curso" en la línea de tiempo laboral [5]. Si esa fecha se omite en un procesamiento masivo, candidatos con currículums antiguos pueden aparecer erróneamente como los más disponibles y experimentados [5]. Para quien redacta su propio CV, la lección práctica es mantener las fechas en un formato estándar y consistente (mes y año) en cada entrada, alineadas a un mismo margen, tal como recomienda el formato Harvard [13].

IV. Semántica de Palabras Clave y Ajuste Algorítmico

A. Funcionamiento semántico: TF-IDF, similitud de coseno y taxonomías de sinónimos

Más allá de la extracción estructural, una capa adicional de muchos ATS modernos compara semánticamente el currículum con la descripción del puesto. Investigación publicada sobre sistemas ATS basados en inteligencia artificial describe el uso de vectorización TF-IDF (frecuencia de término–frecuencia inversa de documento) junto con algoritmos de similitud de coseno para calcular una puntuación de compatibilidad entre el currículum y la vacante, además de un módulo de detección de brechas de habilidades que identifica competencias requeridas y ausentes [8].

Este cálculo de compatibilidad no opera sobre coincidencias de texto literal exclusivamente: se apoya en taxonomías de sinónimos que permiten reconocer que "gestión de nómina" y "payroll management" o "liderazgo de equipos" y "gestión de personal" remiten al mismo concepto. Textkernel, por ejemplo, mantiene una taxonomía con más de 300.000 sinónimos y más de 12.000 habilidades únicas en los idiomas que soporta, además de más de 4.500 profesiones normalizadas [9]. Esta capa semántica es la razón por la que simplemente "rellenar" un currículum con palabras clave sueltas, sin contexto, resulta menos efectivo que integrarlas de forma natural en descripciones de logros verificables.

B. Estandarización y normalización de cargos y habilidades

Los motores de parseo profesionales normalizan explícitamente el título de cargo de una vacante a taxonomías estándar de la industria, incluyendo clasificaciones como ONET 2019, KLDB 2020 e ISCO 2008, además de sus propias taxonomías de profesiones [7]. Esto tiene una implicación directa para quien redacta su CV: si el cargo que ocupó tiene un nombre interno idiosincrático en su empresa anterior (por ejemplo, "Arquitecto de Experiencia de Talento"), conviene acompañarlo o sustituirlo por el título de la industria más reconocible ("Especialista en Adquisición de Talento" o "Talent Acquisition"), de modo que coincida con la forma en que el motor de normalización clasifica esa función.

La orientación profesional de SHRM (Society for Human Resource Management) coincide con este principio desde la perspectiva de la práctica de contratación: recomienda ajustar las habilidades para alinearlas con las palabras clave de la oferta, modificar el orden de las viñetas y, cuando corresponda, usar títulos de cargo más relacionables sin necesidad de reescribir el currículum entero para cada aplicación [6]. Para roles de perfil técnico, este mismo principio de estandarización terminológica se aplica con ejemplos concretos en el artículo sobre qué hace un desarrollador backend y en la comparativa de lenguajes de programación backend más utilizados, útiles como referencia de nomenclatura de habilidades duras reconocibles por el sector.

C. Estrategia de inclusión de palabras clave en múltiples secciones y umbral del 75%

Las palabras clave no deben concentrarse en una única sección. La recomendación de SHRM es distribuirlas a lo largo del resumen profesional, la lista de habilidades o competencias, las descripciones de puestos anteriores, las declaraciones de logros, la educación, afiliaciones, voluntariado e idiomas, es decir, en prácticamente cualquier sección incluida en el documento [14]. Esta misma fuente distingue categorías de palabras clave —habilidades duras, habilidades blandas y títulos de cargo, entre otras— y ofrece un listado ilustrativo de términos de alto valor para el área de Recursos Humanos: Benefits & Compensation, Employee Communications, Employee Relations, Human Resource Information Systems (HRIS), Job Analysis, Labor & Union Negotiations, Leadership Development, Organizational Development, Performance Management, Recruitment, Retention, Staffing, Succession Planning, Talent Development y Training & Development [14]. Varios de estos términos son precisamente los que un currículum orientado a un puesto de dirección de Recursos Humanos debería incorporar de forma verificable y contextualizada, tal como refleja la ficha de competencias al inicio de este artículo.

En cuanto al criterio de decisión sobre a qué vacantes aplicar, SHRM recomienda un umbral práctico: los candidatos deberían cubrir al menos el 75% de los requisitos solicitados en una oferta para ser considerados seriamente, sin que esto signifique que deba evitarse aplicar a un puesto aspiracional por no cumplir el 100% de los requisitos [6]. Este umbral no es un artefacto arbitrario de un solo consultor: es coherente con la lógica de puntuación de compatibilidad basada en similitud de coseno descrita en la investigación sobre ATS con IA, donde el sistema calcula una puntuación de coincidencia y clasifica a los candidatos por encima o por debajo de un rango de corte definido por el reclutador [8].

La estrategia recomendada combina, entonces, tres elementos: seleccionar con cuidado las vacantes a las que se aplica en lugar de enviar el mismo documento de forma masiva, identificar las palabras clave literales y sus variantes semánticas dentro de la descripción del puesto, y distribuir esas palabras clave —con contexto y resultados cuantificados— en el resumen, la experiencia, la educación y las certificaciones [6][14][2]. Este mismo enfoque de estructurar procesos y terminología de forma consistente y verificable es análogo al que se sigue al diseñar procesos internos de talento, como se describe en la guía sobre cómo diseñar un proceso de onboarding técnico eficaz para nuevos empleados, donde la claridad estructural cumple una función equivalente a la que cumple en un currículum bien parseado.

Conclusión

Optimizar un currículum para sistemas ATS no consiste en "engañar" a un algoritmo, sino en comprender que ese algoritmo es, en esencia, un lector automatizado con reglas de interpretación específicas: privilegia estructuras simples, encabezados universales, fechas consistentes y terminología normalizada frente a la industria. Un documento en columna única, sin tablas ni gráficos, con secciones bajo nombres estándar y palabras clave distribuidas de forma natural y verificable en todo el texto, no solo atraviesa el parser con mayor tasa de éxito, sino que llega al reclutador humano con la información correctamente clasificada y lista para ser evaluada sobre su verdadero mérito.

Fuentes Oficiales y Referencias Consultadas