Software de evaluación de talento · +15,334 empresas
Investigación original · Guía para reclutamiento

¿Cuántas pruebas debe incluir una batería psicométrica?

Respuesta observada: 3–4 pruebas alcanzaron 83.35% y 83.09% de finalización a 30 días. Analizamos 623,529 episodios con 1,796,497 pruebas. El resultado no establece un número universal: la composición y la operación importan tanto como el tamaño.

Corte 2026-09-01Finalización observada a 30 díasDatos agregados y anonimizados

Autor y director del proyecto: Jorge Hurtado, Mtro. en Dirección Estratégica de la Calidad · Publicado el 2 y revisado el 3 de septiembre de 2026 · Versión analítica: battery run 1.

La respuesta para reclutamiento

3–4 pruebasno mostraron menor finalización que 1–2
Composiciónexplica diferencias que el tamaño oculta
Sin causalidaduso observado no es receta universal

No recomendamos fijar el mismo número para todas las vacantes. Empiece por la evidencia necesaria para decidir y conserve cada instrumento solo si responde una pregunta laboral distinta. Una batería corta puede estar mal diseñada y una más amplia puede completarse bien cuando su propósito, comunicación y operación son claros.

Alcance antes de leer cifras: son asignaciones realizadas por clientes de PsicoSmart, no una muestra aleatoria del mercado. “Finalización” significa completar todas las pruebas del episodio dentro de 30 días. La asociación no demuestra que agregar o retirar una prueba cause el cambio.

Cuatro hallazgos inéditos

01

No apareció una penalización lineal

Tres pruebas alcanzaron 83.35% y cuatro 83.09%; una registró 81.73% y dos 81.07%. Cinco fue el grupo menor, con 78.85%, pero seis o más volvió a 81.22%.

Decisión: no imponer un límite universal basándose solo en el promedio global.

02

La composición cambia la lectura

Entre composiciones de una sola prueba que pasaron controles de diversidad, la finalización osciló aproximadamente entre 60% y 89%. Baterías con igual tamaño pueden producir experiencias distintas.

Decisión: estimar duración y fricción por instrumentos concretos, no únicamente por cantidad.

03

La mayor recuperación ocurre pronto

Entre 7 y 30 días, la finalización completa aumentó entre 1.7 y 3.9 puntos según tamaño. En seis o más pruebas pasó de 77.36% a 81.22%.

Decisión: concentrar comunicación, soporte y recordatorios en las primeras dos semanas.

04

Dentro de empresa, 3 frente a 4 casi empata

En organizaciones con al menos diez episodios de ambos tamaños, la diferencia ponderada entre tres y cuatro fue de 0.36 puntos. Entre cuatro y seis o más fue 0.11 puntos.

Decisión: auditar aporte incremental; el contexto operativo pesa más que sumar una prueba.

Finalización completa por tamaño

Finalización a 30 días por número de pruebasLas tasas van de 78.85% para cinco pruebas a 83.35% para tres.1 prueba81.73%2 pruebas81.07%3 pruebas83.35%4 pruebas83.09%5 pruebas78.85%6 o más pruebas81.22%

Fuente: PsicoSmart, run de baterías 1. Episodios asignados del 1-sep-2025 al 31-jul-2026.

PruebasEpisodios7 días30 días
1173,04980.02%81.73%
2120,04879.15%81.07%
3134,98981.50%83.35%
494,22280.82%83.09%
555,98376.31%78.85%
6 o más45,23877.36%81.22%
Cómo leerlo: estas son tasas descriptivas, no la probabilidad que tendrá su empresa. Los grupos contienen combinaciones, puestos y organizaciones diferentes.

Composiciones seleccionadas para mostrar el contraste

Esta tabla no reproduce las primeras filas del CSV ni constituye un ranking de eficacia. Presenta siete casos ordenados por finalización para hacer visible el contraste. HonestiValues + Kostick registró 89.28%, 16PF 88.71% y Dominos 60.02%; las diferencias también pueden reflejar empresas, puestos, comunicación y población.

Composición observadaPruebasEpisodiosFinalización 30 días
HonestiValues + Kostick21,86589.28%
16PF16,37688.71%
HonestiValues169,31786.26%
Cleaver118,77283.16%
Cleaver + HonestiValues29,88079.47%
Terman-Merrill110,11476.92%
Dominos13,50960.02%

Descargar las 30 composiciones publicables en CSV

El CSV completo conserva el orden técnico del dataset. Solo se publican composiciones con al menos 100 episodios, 20 organizaciones, participación máxima de una organización ≤25% y al menos 8 organizaciones efectivas.

Qué cambia al comparar dentro de la misma organización

Cada comparación incluye únicamente organizaciones con al menos diez episodios de ambos tamaños. Esto reduce el efecto de mezclar clientes, aunque no controla puesto, instrumentos, duración ni cambios operativos.

ComparaciónOrganizacionesDiferencia ponderada
3 frente a 4 pruebas898+0.36 pp
4 frente a 5 pruebas686-0.78 pp
4 frente a 6 o más pruebas426+0.11 pp

La cercanía de 3 frente a 4 (+0.36 puntos) y de 4 frente a 6 o más (+0.11) respalda una conclusión prudente: el tamaño aislado aporta poca orientación en esas comparaciones y la composición debe auditarse.

Descargar las 15 comparaciones dentro de organización

Cómo diseñar una batería defendible

PasoPregunta de reclutamientoEvidenciaCriterio para retirar
1. Decisión¿Qué decisión debe mejorar?Riesgos y conductas críticas del puesto.Si no cambia ninguna decisión documentada.
2. Aporte¿Qué pregunta distinta responde cada prueba?Constructo, calidad técnica y relación con el puesto.Si duplica evidencia ya disponible.
3. Carga¿Cuánto tiempo y esfuerzo exige el conjunto?Duración real, dispositivo, accesibilidad y soporte.Si el costo supera el aporte incremental.
4. Secuencia¿Qué debe aplicarse primero?Núcleo breve y pruebas condicionales para finalistas.Si se aplica a todos sin necesidad.
5. Seguimiento¿Dónde se pierde al candidato?Finalización a 7, 14 y 30 días por composición.Si mantiene fricción sin evidencia nueva.
Descargar datos agregados en CSV

Dataset publicado bajo CC BY 4.0: condiciones y atribución.

Modelo práctico: núcleo + módulos

Use un núcleo mínimo relacionado con todos los finalistas y añada módulos solo por exposición del puesto: ventas, manejo de activos, liderazgo, razonamiento o seguridad. Esto convierte la batería en un diseño argumentado, no en una lista acumulada por costumbre. Para elegir qué evidencia aporta cada instrumento, consulte también el marco para seleccionar pruebas psicométricas por necesidad del puesto.

Metodología, responsabilidad y limitaciones

Responsable: equipo de investigación de PsicoSmart. El procesamiento fue automatizado mediante un materializador versionado; la interpretación, los límites y la decisión de publicación fueron revisados editorialmente. Esta página reproduce el snapshot aprobado battery run 1 y no recalcula datos durante la visita.

  • Unidad: shard + organización + candidato + marca exacta de asignación. El código de PsicoSmart inserta conjuntamente las pruebas del lote.
  • Periodo: asignaciones del 1 de septiembre de 2025 al 31 de julio de 2026; todos los episodios tuvieron al menos 30 días de observación.
  • Universo: 623,529 episodios y 1,796,497 pruebas; se excluyeron códigos técnicos `e_%` y registros legados sin fecha de asignación reconstruible.
  • Finalización: todas las pruebas con `porcentaje=100` dentro de 30 días. Se documentó tolerancia de 12 horas por un formato histórico de reloj; afectó una fracción pequeña.
  • Privacidad: no se publican candidatos, respuestas ni organizaciones. Cada tamaño superó 1,888 organizaciones observadas y ninguna concentró más de 5.68%.
  • Comparaciones: el análisis dentro de organización exige al menos diez episodios de cada tamaño comparado. Reduce mezcla entre clientes, pero no controla puesto, dificultad, motivación ni duración de cada instrumento.
  • Límite causal: no hubo asignación aleatoria. Las tasas no prueban que el tamaño cause finalización ni clasifican la calidad de una prueba.

Diseñe la batería desde el puesto, no desde una cifra

PsicoSmart permite combinar instrumentos y revisar resultados dentro de un proceso estructurado.

Conocer PsicoSmart