La fiabilidad test-retest
Que un test te dé la misma respuesta dos veces es un número medible, y es el primero que conviene pedir. Qué aspecto tienen las cifras para rasgos y para tipos, y por qué una categoría es mucho menos estable que la puntuación de debajo.
Cómo medimos
La fiabilidad test-retest responde a una sola pregunta: si la misma persona hace el mismo test dos veces, sin que pase nada importante en medio, ¿cuánto se parecen los dos resultados?
Se informa como una correlación entre las dos ocasiones, y es el número menos vistoso de la psicometría. También es el primero que hay que buscar, porque todo lo demás que un test afirma depende de él. Una medida que no se pone de acuerdo consigo misma en quince días no puede estar midiendo una propiedad estable tuya. Está midiendo la quincena.
El hallazgo que más importa aquí no es que los tests de personalidad sean poco fiables. Las puntuaciones de rasgos son bastante más estables de lo que la gente espera. Es que una categoría construida encima de una puntuación estable es mucho menos estable que la puntuación —— y casi todos los tests populares te entregan la categoría y esconden la puntuación.
«Fiable» en español significa dos cosas, y solo una es esta
Antes de las cifras hay que deshacer un nudo que el lector inglés no tiene.
En castellano corriente, fiable quiere decir de fiar. «¿Es fiable ese test?» significa casi siempre «¿me puedo creer lo que me dice?». En psicometría, fiabilidad significa otra cosa bastante más modesta: que la medición se repite. Son dos preguntas distintas y la segunda tiene un nombre propio, validez, que tiene su propia entrada.
La confusión no es inocua, porque permite un truco de venta. Un test puede contestar la pregunta barata —— «sale lo mismo dos veces» —— y dejar que el lector la oiga como la cara —— «dice la verdad sobre ti». Una báscula descalibrada cinco kilos de más es perfectamente fiable y completamente inválida: misma respuesta siempre, equivocada siempre.
La relación entre las dos va en un solo sentido y conviene memorizarla así: la fiabilidad pone el techo de la validez, y no la suministra. Un instrumento que no se repite no puede ser válido. Uno que se repite puede seguir sin medir nada de lo que dice medir.
Los números
Cifras aproximadas, de estudios de fiabilidad publicados y no de páginas de venta.
Escalas de rasgos a lo largo de semanas. Los instrumentos de cinco grandes bien construidos repiten alrededor de r = 0,80 en unas semanas y se quedan cerca de r = 0,70 a lo largo de un año. Eso es alto. Significa que el orden de las personas apenas cambia, y que tu puntuación de hoy es una buena apuesta para tu puntuación del mes que viene.
Escalas de rasgos a lo largo de décadas. Roberts y DelVecchio metaanalizaron 152 estudios longitudinales y encontraron que la consistencia de orden sube con la edad: alrededor de r = 0,31 en la infancia, 0,54 en la veintena y cerca de 0,74 entre los 50 y los 70 años. La personalidad es estable, cada vez más, y nunca del todo fija. Ese último punto es el que suelen equivocar los dos bandos.
Tipos de cuatro letras a lo largo de semanas. Aquí se cae. Howes y Carskadon repitieron el test con cinco semanas de intervalo y encontraron que menos de la mitad de los participantes obtuvo el mismo código en las cuatro dicotomías —— las dimensiones individuales aguantaron para aproximadamente entre el 60 y el 80 por ciento de la gente, y cuatro de esas seguidas es una exigencia dura. Las cifras posteriores varían con el intervalo y la muestra, y las del propio manual también, pero la forma es constante y la revisión de Pittenger la trata como el problema central del instrumento y no como una nota al pie.
Fíjate en que estos dos hechos no se contradicen. Las preferencias de debajo se movieron poco. La categoría se movió mucho, porque estaba sentada sobre un límite.
Por qué una categoría es mucho menos estable
Este es el mecanismo, y se ve entero en un ejemplo.
Supón que tu puntuación de pensamiento-sentimiento está en el 52 por ciento hacia el sentimiento. Quince días después, tras una buena semana en vez de una mala, está en el 48. La medición apenas se ha movido —— bien dentro del error de cualquier cuestionario corto —— y para los estándares del rasgo es la misma lectura dos veces.
Pero la letra ha cambiado. La F se ha vuelto T. La etiqueta cambió, la descripción del tipo cambió, el código de cuatro letras que le dices a la gente cambió, y nada tuyo lo hizo.
Ahora compónlo. Un código de tipo tiene cuatro de estos límites, y a una persona le basta con estar cerca de uno para que el código cambie. Por eso la inestabilidad de las categorías es tanto mayor que la de las escalas: no estás preguntando si una medición es estable, estás preguntando si cuatro mediciones independientes se quedan todas del mismo lado de cuatro rayas. La entrada sobre el punto de corte cubre dónde caen esas rayas respecto a dónde puntúa la gente de verdad, que es lo que hace esto frecuente y no raro.
Se siguen dos implicaciones. El medio es donde los resultados son menos fiables, y la mayoría de la gente está en el medio. Y una letra que cambia no suele ser una persona que ha cambiado —— es lo más probable que le pase a una puntuación fronteriza, y leerlo como crecimiento personal o como prueba de fraude son las dos lecturas excesivas. Si es tu caso, por qué cambia el resultado de tu test de personalidad lo desarrolla con más calma.
Qué mueve una puntuación con motivo
No toda la inestabilidad es ruido. Parte es el test recogiendo correctamente algo real que tú no pretendías medir.
El estado de ánimo. Howes y Carskadon lo miraron directamente: la concordancia entre sesiones era menor en las personas cuyo ánimo había cambiado. Un cuestionario que pregunta cómo te comportas normalmente se contesta desde cómo te sientes ahora, porque esa es la evidencia que tienes a mano.
El contexto de aplicación. Contestar en el trabajo, para el trabajo, produce respuestas distintas de contestar en casa para ti. El marco de referencia cambia lo que significa «normalmente».
El grupo de referencia. Te puntúas frente a la gente que te rodea. Múdate a un sitio de trabajo más ruidoso y tu extraversión autoinformada baja sin que tu conducta haya cambiado nada, un efecto documentado entre culturas y tratado en los estilos de respuesta.
Que una medida de estado se mueva no es un fallo. Algunos instrumentos tienen que ser inestables, porque lo que leen lo es. Que una medida de patrón de ánimo como el Moody Test salga distinta en una semana dura es el instrumento funcionando, no fallando —— el error está solo en esperar que una lectura de estado se comporte como una de rasgo. Comprueba cuál de las dos hiciste antes de preocuparte por un cambio.
Cambio real. La personalidad se mueve, casi siempre despacio y casi siempre en una dirección —— la gente tiende a volverse más responsable y más estable emocionalmente a lo largo de la veintena y la treintena. En cinco años, parte de un desplazamiento es real. En cinco semanas, prácticamente nada.
La regla práctica: una diferencia entre dos sesiones separadas por un mes es medición. Una diferencia a lo largo de varios años, en la misma dirección, sobre una escala y no sobre una letra, puede que seas tú.
Qué pedirle a un test, incluidos los nuestros
Tres cosas, por orden de cuánto te dicen.
¿Publica alguna cifra de repetición? La mayoría de los tests gratuitos no, y la ausencia es informativa —— no porque el test sea necesariamente malo, sino porque nadie lo ha comprobado. Un test que no informa de ningún estadístico de fiabilidad está pidiendo que se confíe en él, no que se lo evalúe.
¿Informa de una puntuación además de una etiqueta? Una etiqueta sola no permite que el lector compruebe su estabilidad. Cuatro porcentajes sí: hazlo dos veces y mira cuánto se movió cada uno. Esta es una de las razones de que los cinco grandes sean el instrumento más útil para repetir —— nunca convierte tu puntuación en un bando, así que no hay nada que pueda girar.
¿Muestra un intervalo o un punto? Un número único implica una precisión que ningún cuestionario corto tiene.
Y aquí, en español, hay un sitio adonde mirar que en inglés no existe con esta forma. Para los tests editados en España, la Comisión de Test del Consejo General de la Psicología evalúa periódicamente las pruebas recién publicadas con el CET-R, una adaptación española del modelo de revisión de la EFPA, y la fiabilidad es una de las dimensiones puntuadas; los informes se publican y se pueden consultar. Eso significa que, para un instrumento profesional en castellano, la pregunta de este apartado tiene una respuesta pública. Para un test gratuito de internet no la tiene en ningún idioma, y la diferencia entre las dos situaciones es el tema entero de tests gratuitos y evaluaciones formales.
Un aviso que casi ninguna web traducida da: el coeficiente no cruza la traducción. Si un manual inglés informa de r = 0,80, está informando de la versión inglesa con su muestra. La adaptación al español es un instrumento distinto y necesita su propio estudio de estabilidad —— es una de las exigencias explícitas de las directrices internacionales para adaptar tests, publicadas en castellano por Muñiz, Elosua y Hambleton. Una web que traduce los ítems y hereda las cifras del original está heredando algo que no le pertenece.
Con esos criterios nuestros propios tests salen desiguales, y conviene concretar. El test de estilo MBTI informa de las cuatro dimensiones en porcentajes junto al código, justamente para que quien esté cerca del 50 lo vea —— y 36 ítems para cuatro dimensiones son nueve por dimensión, que es una medición corta y debe leerse como una banda. No publicamos un coeficiente de repetición, porque no hemos hecho el estudio. Es una carencia real, es la misma que tiene casi cualquier test gratuito de internet, y no se hace más pequeña por ser común.
Lo que sí podemos decirte sin estudio es lo que esta página existe para decir: si tu resultado queda cerca del medio en alguna dimensión, espera que cambie, no leas el cambio como algo significativo, y usa el porcentaje en lugar de la letra.
fuentes
- · Myers, I. B., McCaulley, M. H., Quenk, N. L., Hammer, A. L. (1998). MBTI Manual: A Guide to the Development and Use of the Myers-Briggs Type Indicator (3rd ed.). Consulting Psychologists Press.
- · Howes, R. J., Carskadon, T. G. (1979). Test-retest reliabilities of the Myers-Briggs Type Indicator as a function of mood changes. Research in Psychological Type, 2(1), 67–72.
- · Pittenger, D. J. (2005). Cautionary comments regarding the Myers-Briggs Type Indicator. Consulting Psychology Journal: Practice and Research, 57(3), 210–221.
- · Roberts, B. W., DelVecchio, W. F. (2000). The rank-order consistency of personality traits from childhood to old age: A quantitative review of longitudinal studies. Psychological Bulletin, 126(1), 3–25.
- · Muñiz, J., Elosua, P., Hambleton, R. K. (2013). Directrices para la traducción y adaptación de los tests: segunda edición. Psicothema, 25(2), 151–157.
- · Hernández, A., Ponsoda, V., Muñiz, J., Prieto, G., Elosua, P. (2016). Revisión del modelo para evaluar la calidad de los tests utilizados en España. Papeles del Psicólogo, 37(3), 192–197.
Más de la base de conocimiento
Conflicto y reparación
Hallazgos de la era Gottman sobre qué predice que una relación dure.
🔬Comprendiendo las Raíces de la Teoría de la Personalidad
Los fundamentos de la teoría de la personalidad revelan que la naturaleza humana es a la vez estructurada y fluida — guiada por la biología, moldeada por la cultura y refinada a través de la experiencia. Desde el inconsciente de Freud hasta los modelos cognitivos y de rasgos modernos, cada teoría aporta una pieza al rompecabezas de la individualidad.
🔬La Escuela Psicoanalítica - La Estructura Motivacional Inconsciente
Explica la estructura dinámica inconsciente de Freud, abarcando los niveles de conciencia y el ello, el yo y el superyó, mostrando cómo el inconsciente moldea la personalidad y el comportamiento.