La validez de un test
Un test no es exacto ni inexacto: lo es una afirmación hecha a partir del test. Las cuatro cosas que se llaman exactitud, cuál tiene de verdad un test de personalidad, y la que más se nota es la que menos importa.
Cómo medimos
«¿Es exacto este test?» es la pregunta que más se hace sobre un test de personalidad, y no tiene respuesta, porque está preguntando por el objeto equivocado.
La validez no es una propiedad de un test. Es una propiedad de una afirmación concreta hecha a partir de una puntuación. El mismo cuestionario puede sostener bien una inferencia y no sostener en absoluto otra: una escala de responsabilidad puede ser una base decente para predecir si alguien entrega los gastos a tiempo y una base pésima para decidir si debe ascender. Mismo instrumento, misma puntuación, dos afirmaciones, dos veredictos.
Esto no es un tecnicismo inventado para esquivar la pregunta. Es la posición asentada del campo —— Messick la defendió por extenso, y los Standards for Educational and Psychological Testing, el reglamento compartido de la disciplina, abren con ella. La reformulación útil es: ¿qué se está concluyendo a partir de esta puntuación, y ha comprobado alguien esa conclusión?
Hazlo así y la pregunta pasa a tener respuesta. También se vuelve incómoda, porque para la mayoría de los tests gratuitos la respuesta a la segunda mitad es que no.
Cuatro cosas que se llaman exactitud
Se confunden rutinariamente, también por quien vende tests, y aquí van ordenadas más o menos de la menos informativa a la más.
Validez aparente —— ¿parece que mide lo que dice medir? Un ítem que pregunta si disfrutas de las fiestas trata obviamente de sociabilidad. Es la única clase que un lector puede evaluar por su cuenta, es lo que quiere decir «me ha clavado» cuando alguien sale de un test, y por sí sola no vale casi nada. Un conjunto de ítems puede parecer perfecto y no predecir nada. También funciona al revés: un ítem que predice bien puede parecer absurdo, que es por lo que algunas escalas clínicas contienen preguntas aparentemente irrelevantes.
Validez de contenido —— ¿cubren los ítems el constructo entero? Una escala de responsabilidad que solo pregunta por el orden se ha dejado fuera la persistencia, la deliberación y el cumplimiento. Los tests cortos de internet fallan aquí constantemente, porque cubrir cuesta ítems y los ítems cuestan tasa de finalización.
Validez de criterio —— ¿predice la puntuación algo que está fuera del test? Aquí es donde una medida se gana el sueldo. El metaanálisis de Barrick y Mount estableció que la responsabilidad predice el rendimiento laboral en distintas ocupaciones, con una correlación modesta en términos absolutos y de las más sólidas de la psicología aplicada. Con un número así en la mano, deja de importar qué aspecto tengan los ítems.
Validez de constructo —— ¿se comporta la puntuación como debería comportarse el concepto de fondo? Es la aportación de Cronbach y Meehl y la más amplia de las cuatro. Exige una red de evidencia: la puntuación debe correlacionar con aquello con lo que el concepto debería relacionarse (convergente) y no correlacionar con aquello de lo que debería distinguirse (discriminante). Lo que vieron Campbell y Fiske es que la segunda mitad importa tanto como la primera, y es la mitad que más se salta. Una escala nueva que correlaciona 0,80 con una medida de ansiedad ya existente no ha demostrado un constructo nuevo. Ha rebautizado uno.
Fiable no es válido
La relación entre las dos corre en un solo sentido y conviene decirla exacta.
La fiabilidad pone techo a la validez; no la suministra. Una medida que no se pone de acuerdo consigo misma no puede ponerse de acuerdo con nada más, así que sin fiabilidad no hay validez posible. Pero al revés no funciona: una medida puede repetirse perfectamente y estar midiendo la cosa equivocada con una consistencia admirable. Un test que informa de una cifra alta de fiabilidad y de ninguna evidencia de validez te ha dicho que es constante, lo que deja enteramente abierto qué es lo que mide con constancia. La fiabilidad test-retest es lo primero que hay que preguntar y nunca lo último —— y ahí está también el enredo que tiene este asunto en castellano, donde «fiable» en lengua corriente significa de fiar y en psicometría significa otra cosa bastante más modesta.
Hay una trampa asociada del lado de la fiabilidad. La consistencia interna —— que suele informarse como alfa de Cronbach —— sube cuando los ítems son casi duplicados unos de otros. Una escala de diez paráfrasis de la misma frase tendrá un alfa espléndido y una validez de contenido lamentable. Un alfa alto es a veces señal de una escala bien construida y a veces señal de una escala estrecha, y desde fuera las dos cosas se ven igual.
En español, «válido» y «validado» dicen otra cosa
Antes de seguir hay que desmontar dos palabras, porque en castellano no llegan limpias.
«¿Es válido este test?» casi nunca está preguntando lo que pregunta este artículo. En español corriente, válido significa vigente, reconocido, admitido por alguien: un DNI válido, un título válido, una firma válida. Así que la pregunta que tiene en la cabeza quien la escribe suele ser «¿esto lo reconoce alguien?, ¿lo aceptaría un psicólogo?, ¿es oficial?». Es una pregunta legítima, tiene respuesta, y no es esta. La respuesta institucional va por el camino de quién edita el instrumento, quién puede comprarlo y quién responde por el informe, que es el asunto de los tests gratuitos y la evaluación formal. La validez de la que trata esta entrada es otra cosa: si la conclusión que sacas del número se sostiene.
«Validado científicamente» es el sello que llevan casi todas las webs de tests en español, y merece leerse con cuidado, porque como afirmación está vacía. Validado ¿para concluir qué? ¿Contra qué criterio externo? ¿Con qué muestra y de qué país? Un instrumento no se valida de una vez y para siempre, como quien pasa una ITV: se acumula evidencia a favor de un uso concreto, y esa evidencia se cita o no existe. Prieto y Delgado lo dejan escrito en el manual de referencia en castellano sobre el asunto: lo que se valida son las interpretaciones de las puntuaciones, no el test.
La regla práctica es corta. Si una página dice «validado científicamente» y no nombra ni el estudio, ni el criterio, ni la muestra, no ha hecho una afirmación comprobable; ha puesto una medalla. Y si lo dice acompañado de un nombre propio —— «avalado por psicólogos» —— tampoco: el aval de una persona no es evidencia de criterio, es una firma.
La validez no viaja con la traducción
Esta es la parte que un lector inglés no necesita y tú sí.
Prácticamente toda la evidencia de criterio que se cita en este terreno —— empezando por Barrick y Mount —— se estableció en mercados laborales angloparlantes, con muestras de Estados Unidos, Reino Unido y Canadá, y con criterios de rendimiento definidos por esas empresas. Eso no la invalida. Sí acota lo que demuestra.
Cuando un test se traduce al castellano, hereda los ítems. No hereda la evidencia. Y no es solo que haya que repetir los estudios: es que un ítem traducido puede cambiar de significado lo suficiente como para que la misma puntuación signifique cosas distintas a los dos lados. Esa propiedad tiene nombre propio —— invarianza de medida —— y se comprueba con datos: hay que verificar que la estructura del constructo, los pesos de los ítems y los umbrales se comportan igual en la nueva población antes de poder comparar nada. Las directrices internacionales de adaptación de tests, publicadas en castellano por Muñiz, Elosua y Hambleton, dedican a esto buena parte de sus veintidós puntos, y su premisa es explícita: adaptar un test no es traducirlo.
Un ejemplo de por qué no es un tecnicismo. Un ítem de asertividad que en inglés describe una conducta corriente puede describir, traducido literalmente, una conducta que en un contexto hispanohablante se lee como brusca. Quien contesta «nunca» no está puntuando bajo en asertividad: está puntuando alto en no ser un maleducado. La puntuación se mueve, el constructo no, y el percentil resultante compara dos cosas distintas.
Hay una versión hermana de este argumento del lado de la fiabilidad —— que un coeficiente publicado en un manual inglés no pertenece a la versión española —— y vive en la entrada sobre fiabilidad test-retest, junto con quién comprueba esto en España. Aquí basta con la consecuencia: una web que traduce los ítems y hereda las cifras del original está afirmando algo que nadie ha comprobado en tu idioma.
Cómo comparan los instrumentos, y qué podemos responder nosotros
A brocha gorda, porque el detalle está en los manuales, pero el orden no es polémico. Los instrumentos de los cinco grandes tienen la mejor evidencia en personalidad: la estructura de cinco factores se recupera en distintos idiomas y métodos, las escalas predicen resultados laborales, de salud y de pareja con tamaños de efecto pequeños o moderados, y la base de investigación es lo bastante grande como para que los fracasos también estén documentados. Los instrumentos de cribado clínico se validan contra diagnósticos hechos por otra vía, que es un criterio exigente, y por eso vienen con cifras publicadas de sensibilidad y especificidad; están validados para una finalidad —— señalar a quién conviene evaluar en serio —— y son inválidos para aquella a la que casi todo el mundo los destina, que es autodiagnosticarse. El MBTI tiene fiabilidad razonable en las escalas de fondo, convergencia real con dimensiones de los cinco grandes, y evidencia floja para lo que lo hace distintivo: que las categorías sean categorías, que el código prediga rendimiento o encaje en un equipo, que exista la pila de funciones. La convergencia es el hallazgo interesante, porque significa que el instrumento mide algo real y después lo informa en un formato que tira información; los marcos de tipos desarrolla esa idea. Los formatos de entretenimiento —— colores, animales, cuadrantes estéticos —— tienen validez aparente y nada más, por diseño, y eso no es un defecto mientras nadie finja lo contrario.
Cuatro preguntas, en orden, que llevan un minuto y descalifican a casi todo lo que encuentres. ¿Cuál es la afirmación? No «¿es exacto?», sino «exacto para concluir qué». Escribe la frase sobre la que quieres actuar. ¿Contra qué se comprobó? Una afirmación de validez necesita un criterio externo; si una página solo cita sus propios estadísticos internos, no ha hecho ninguna. ¿De qué tamaño es el efecto? «Predice el rendimiento laboral» es compatible con una correlación que mueve las probabilidades un poco. Casi todos los efectos reales en personalidad son pequeños, y pequeño no es nada —— simplemente no es lo que insinúa una página de ventas. ¿Quién estaba en la muestra? Un coeficiente establecido con universitarios de un país es evidencia sobre universitarios de un país, y la entrada de percentiles y baremos cubre qué pasa cuando el grupo de comparación no se parece a ti.
Vuelto hacia nosotros, el balance es desigual y conviene dejarlo por escrito. Nuestro test de los cinco grandes está construido sobre la tradición de bancos de ítems de dominio público, así que el constructo al que apunta tiene décadas de evidencia de validez detrás —— pero esa evidencia pertenece a los instrumentos establecidos, no automáticamente a nuestra versión de treinta ítems, y no hemos publicado ningún estudio de validación propio, ni en inglés ni en español. Los tests de carrera y de trabajo informan de patrones que sirven para pensar; no hacemos ninguna afirmación de validez de criterio sobre ellos, y no deberías tratar una puntuación de potencial de liderazgo como una predicción de cómo liderarías, ni una de inteligencia emocional en el trabajo como una medición de cómo caes a tus compañeros: los dos son rasgos evaluativos y muy visibles, que es exactamente donde los autoinformes son menos exactos, por las razones que expone qué puede ver un autoinforme. Los bancos de estilo cribado dicen «esto no es un diagnóstico» en cada pantalla porque es la única afirmación que pueden sostener.
La regla vale para nosotros tanto como para cualquiera: una página de test que te cuenta qué significa un resultado y nunca contra qué se comprobó está pidiendo una confianza cuyas cuentas no ha enseñado.
fuentes
- · Cronbach, L. J., Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281–302.
- · Campbell, D. T., Fiske, D. W. (1959). Convergent and discriminant validation by the multitrait-multimethod matrix. Psychological Bulletin, 56(2), 81–105.
- · Messick, S. (1995). Validity of psychological assessment: Validation of inferences from persons' responses and performances as scientific inquiry into score meaning. American Psychologist, 50(9), 741–749.
- · American Educational Research Association, American Psychological Association, National Council on Measurement in Education (2014). Standards for Educational and Psychological Testing. AERA.
- · Barrick, M. R., Mount, M. K. (1991). The Big Five personality dimensions and job performance: A meta-analysis. Personnel Psychology, 44(1), 1–26.
- · Prieto, G., Delgado, A. R. (2010). Fiabilidad y validez. Papeles del Psicólogo, 31(1), 67–74.
- · Muñiz, J., Elosua, P., Hambleton, R. K. (2013). Directrices para la traducción y adaptación de los tests: segunda edición. Psicothema, 25(2), 151–157.
Más de la base de conocimiento
Conflicto y reparación
Hallazgos de la era Gottman sobre qué predice que una relación dure.
🔬Comprendiendo las Raíces de la Teoría de la Personalidad
Los fundamentos de la teoría de la personalidad revelan que la naturaleza humana es a la vez estructurada y fluida — guiada por la biología, moldeada por la cultura y refinada a través de la experiencia. Desde el inconsciente de Freud hasta los modelos cognitivos y de rasgos modernos, cada teoría aporta una pieza al rompecabezas de la individualidad.
🔬La Escuela Psicoanalítica - La Estructura Motivacional Inconsciente
Explica la estructura dinámica inconsciente de Freud, abarcando los niveles de conciencia y el ello, el yo y el superyó, mostrando cómo el inconsciente moldea la personalidad y el comportamiento.