← Blog
Metodología20 de septiembre de 2026Por Johnson

¿Por qué me cambia el resultado del test de personalidad?

Un resultado que se mueve no es la prueba de una persona que se movió. Qué dicen los estudios longitudinales sobre cuánto se estabiliza la personalidad, qué mide en realidad una segunda sesión y por qué en español hay una capa más de confusión.

Tres resultados, tres respuestas distintas, y la sensación incómoda de que el problema es quien hace el test y no el test.

Merece la pena nombrar lo que da por hecho esa sensación: que debajo hay una etiqueta verdadera, y que una sesión suficientemente sincera la recuperaría. Esa premisa es la parte que no sobrevive al contacto con la literatura sobre medición.

.31

consistencia de orden de rango de los rasgos medida en la infancia

.74

la misma cifra entre los 50 y los 70 años

152

estudios longitudinales detrás de esos números

2

códigos de tipo distintos que en español reciben el nombre Arquitecto

Cuánto se estabiliza la personalidad, en realidad

Roberts y DelVecchio reunieron 152 estudios longitudinales y 3,217 correlaciones test-retest para contestar bien a esto, manteniendo constante el intervalo en 6.7 años para que las cifras fueran comparables entre sí.

Consistencia de orden de rango de los rasgos por edad, Roberts y DelVecchio 2000
Infancia0.31r
Años universitarios0.54r
A los 300.64r
De 50 a 700.74r
  • Infancia: 0.31r
  • Años universitarios: 0.54r
  • A los 30: 0.64r
  • De 50 a 70: 0.74r

Dos lecturas de ese gráfico son correctas a la vez y apuntan en direcciones opuestas. La personalidad es estable de un modo que importa, la estabilidad crece con la edad, y en la mitad de la vida el orden de las personas en un rasgo aguanta siete años de forma llamativa. Y también: ninguna de esas cifras se acerca a 1, y la de la infancia es lo bastante baja como para no restringir casi nada.

Lo que mide ese gráfico es el orden de rango: si quien estaba alto sigue estando alto respecto a los demás. Eso es lo que aguanta. No es lo mismo que una puntuación individual quedándose quieta, y está muy lejos de ser lo mismo que una etiqueta quedándose quieta. Añade que las 152 muestras son casi todas norteamericanas y europeas, así que la cifra describe bien a esas poblaciones y se extrapola con prudencia.

En español puede haber cambiado el nombre y no el código

Esta es la capa que el lector en inglés no tiene, y conviene descartarla antes que ninguna otra cosa.

Los nombres de los dieciséis tipos no están unificados. Hay dos tradiciones y en español chocan de frente.

CódigoCómo lo llama 16Personalities en españolCómo lo llama la tradición de Keirsey
INTJArquitectoMente Maestra
INTPLógicoArquitecto

Léelo dos veces. Arquitecto nombra dos códigos distintos según en qué web estés. Alguien que salió Arquitecto en una página, salió Arquitecto en otra y concluyó que su tipo se mantenía estable puede haber cambiado de código sin enterarse. Y al revés: alguien que salió Arquitecto y luego Lógico quizá no se movió nada.

En inglés el mismo choque existe, porque Keirsey llamó Architect al INTP y 16Personalities llama Architect al INTJ. La diferencia es que cada nombre inglés viene con su fuente pegada y la gente que lee del tema los distingue. Al traducir, esa pega se cae, los nombres circulan sueltos por artículos que no citan de dónde salen, y el lector español acaba comparando dos nomenclaturas creyendo que compara dos resultados.

Si el test que has hecho no te enseña el código de cuatro letras junto al nombre, el nombre solo no es información suficiente para comparar nada.

Qué se mueve de verdad entre dos sesiones

Algo real, algo redondeado, y algo que pertenece al instrumento y no a nadie.

La parte real es que un rasgo no es una cantidad constante que uno lleva encima. El trabajo de muestreo de experiencia de Fleeson encontró que a lo largo de dos o tres semanas de vida corriente la persona típica expresa casi todos los niveles de casi todos los rasgos, mientras que la media de todos esos momentos se mantiene casi perfectamente estable. La media es lo que un buen instrumento intenta estimar. Una sola sesión es una extracción de una distribución ancha, y pedirle a alguien que resuma una distribución en veinte preguntas un martes es una operación con pérdidas por diseño.

La parte redondeada es donde vive casi todo el drama. Cualquier instrumento que informe una categoría tiene un punto de corte en algún sitio, y una puntuación cae a un lado o al otro. Una posición de 52 contra 48 produce una letra mayúscula con exactamente la misma seguridad que una de 89 contra 11. Cambian dos respuestas, se mueven cuatro puntos, la letra gira, y en un sistema de cuatro letras gira el perfil entero.

Qué cambióCuánto puede mover una puntuación¿Habla de la persona?
El ánimo, el sueño, la semanaVarios puntos en ítems de energía y expectativasHabla de la semana, que es algo real y no es el rasgo
Para qué contexto se respondióA menudo más que la semanaSí, y conviene anotar cuál fue
Otros ítems, otro baremoVarios puntos, de forma invisibleNo
Estar cerca de un punto de corteNada en absoluto, y la etiqueta gira igualNo
Otro nombre para el mismo códigoNada. Solo el nombreNo
Seis años de vida adultaUna cantidad modesta, en una dirección coherenteSí, y es la única fila que significa lo que la gente espera

Por qué los sistemas de tipos lo empeoran

No tienen mala suerte. Están construidos de una forma que lo garantiza.

Si los dieciséis tipos fueran categorías genuinas, las puntuaciones de cada dimensión se amontonarían en dos extremos con un hueco en medio, que es la forma que toma una medida cuando distingue dos clases de cosa. McCrae y Costa lo comprobaron en 1989 y encontraron la forma corriente de un rasgo continuo: una sola colina con casi todo el mundo cerca del centro. Fraley y colegas llegaron después a lo mismo con análisis taxométricos sobre el apego adulto.

Esa distribución es la causa directa de la inestabilidad. Casi todo el mundo está cerca del medio de al menos una dimensión, así que casi todo el mundo está cerca de al menos un punto de corte, así que casi todo el mundo tiene al menos una letra generada por redondeo. La revisión de Pittenger sobre el instrumento de cuatro letras encontró una concordancia test-retest lo bastante baja como para socavar la pretensión de clasificar, dejando en pie las dimensiones de debajo, que es un veredicto más incómodo que el que suele citar cualquiera de los dos bandos. La entrada sobre marcos de tipos recorre dónde aguanta el modelo de cuatro letras y dónde no, y la de tipos de personalidad frente a estereotipos va sobre lo que pasa después, cuando la etiqueta empieza a usarse como explicación.

El baremo, o contra quién te están comparando

Un percentil no es una propiedad tuya. Es una posición contra un grupo de comparación, y cambiar el grupo cambia el número sin que cambie nada de la persona. La entrada sobre percentiles y baremos son los diez minutos que hacen legible cualquier resultado de cualquier web.

Aquí es donde el asunto se vuelve específico del español. Los tests gratuitos más usados calculan sus percentiles sobre quien ha pasado por su web, que son voluntarios de internet autoseleccionados y que en su mayoría respondieron en inglés. Eso no invalida el resultado. Lo que hace es que la frase «estás en el percentil 70 de extraversión» signifique, literalmente, «eres más extravertido que el 70% de la gente que hizo este test en esa web», y esa gente no es tu país.

Y ahora la parte que no favorece al argumento, que es justo por la que merece la pena escribirla.

Lo que se mueve no es la traducción. El BFI-2 tiene una adaptación española publicada, con estructura factorial comprobada a nivel de dominios y de facetas, invarianza de medida y estabilidad temporal medida en dos oleadas. Y el proyecto que adaptó el mismo instrumento de forma coordinada a cinco idiomas encontró propiedades psicométricas muy comparables entre las seis versiones y entre cada adaptación y el original inglés. Es decir: un instrumento de rasgos bien traducido sí viaja. Echarle la culpa al idioma sería cómodo y sería falso. El problema está en el punto de corte y en el baremo, no en las palabras.

Dicho eso, hay un punto donde el idioma sí muerde, y es el registro. Un mismo juego de ítems tiene que funcionar en veinte países con vocabularios cotidianos distintos, y una frase que suena natural en Valladolid puede sonar rara en Guadalajara. En un instrumento de 120 ítems eso se promedia. En uno de 20 no.

Qué merece la pena leer en un resultado que se movió

Un resultado que se mueve suele tomarse como un fallo del test o de la persona. Informa más leído como lo que es, una medición.

Un resultado que se movió
Una persona que cambió
Dos sesiones con un mes de diferencia
Dos sesiones con años de diferencia
Una letra distinta, tres iguales
Un desplazamiento coherente en una dimensión, en una dirección
La dimensión que se movió es la que está más cerca del medio
La dimensión que se movió no estaba cerca del medio
Las dos sesiones se respondieron para contextos distintos
El mismo contexto las dos veces
Cambió el nombre del tipo, no el código
Cambió el código
No cambió nada en la vida
Cambió algo estructural, y la puntuación fue detrás

La dimensión que no para de girar te está diciendo dónde estás. Estar genuinamente equilibrado entre dos polos es una manera de ser, y es una manera para la que un sistema de dos casillas no tiene notación, así que alterna entre dos descripciones que están las dos un poco equivocadas. Eso es información sobre una persona, entregada mal.

La dirección de un cambio también lleva algo. Los resultados hechos después de una racha dura se mueven a menudo hacia un perfil menos halagador, y la lectura honesta no siempre es ruido. La gente responde a la primera sesión con algo de aspiración y a las siguientes con algo más de llaneza, y un desplazamiento en esa dirección puede ser una ganancia de exactitud y no una pérdida de estabilidad.

Y un resultado que se mueve después de un cambio estructural real está haciendo su trabajo. Una ciudad nueva, un trabajo nuevo, el final de algo largo. Esos acontecimientos mueven puntuaciones, y un instrumento que informara el mismo número a través de todos ellos estaría midiendo menos de lo que dice medir.

La parte que no se mueve

Sería fácil terminar con que nada es medible, y esa conclusión tampoco se sostiene.

Las cifras de orden de rango del gráfico son, para lo que se maneja en psicología, altas. Quien está en un extremo de una dimensión a los treinta es muy probable que siga cerca de ese extremo a los cuarenta. Los niveles medios derivan en una dirección coherente a lo largo de la vida adulta, con la mayoría de la gente volviéndose algo más responsable y algo más estable emocionalmente, y esa deriva tarda décadas y se ve en datos de población, no en las dos sesiones de una persona.

Así que el instrumento hace algo. Lo que no hace es emitir un veredicto, y el hueco entre esas dos afirmaciones es donde vive casi toda la decepción con los tests de personalidad. Si lo que buscabas era saber cuáles merecen la pena, encontrar un test de carácter psicométrico de verdad va por ahí, cuáles de los tests gratuitos que hay en internet aguantan esa mirada repasa los que de verdad se usan, y los dieciséis perfiles de tipo se pueden leer sin hacer ninguna prueba.

La pregunta que la gente hace es cuál de los resultados es el verdadero. La mejor pregunta es qué está midiendo la distancia entre ellos, porque esa distancia suele ser lo más concreto que produjo cualquiera de las dos sesiones.

Sources

Frequently asked questions

¿Cada cuánto conviene repetir un test de personalidad?

Una vez al año es un intervalo defendible y cualquier cosa por debajo de unos meses está midiendo la semana. La excepción es cuando ha cambiado algo estructural, como un trabajo nuevo, el final de una relación o una mudanza, porque esos son los acontecimientos que mueven las respuestas de forma legítima. Repetirlo tres veces en quince días produce tres lecturas de los mismos quince días.

¿Los tests gratuitos dan resultados distintos que los de pago?

Con frecuencia, y la razón suele ser prosaica antes que turbia. Cada instrumento usa ítems distintos, en número distinto y con un grupo de comparación distinto, así que una puntuación expresada contra un baremo no coincide con la de la misma persona contra otro. Los instrumentos largos son más fiables en el sentido estrecho de que promedian más ruido por dimensión. La extensión por sí sola no hace válido un instrumento.

¿Respondo como soy en el trabajo o como soy en casa?

Elige uno y anota cuál, porque los dos rara vez coinciden y promediarlos describe a una persona que no existe en ninguno de los dos sitios. Casi todos los instrumentos generales quieren implícitamente la versión de todas las situaciones, que es la que predice cosas a lo largo de los años. La versión del trabajo sirve más para una decisión concreta sobre un puesto concreto y conviene etiquetarla así en lugar de tomarla por la buena.

¿Un mal día puede cambiar mi resultado?

Sí, de una forma medible y a menudo mayor de lo que se supone, sobre todo en los ítems sobre energía, sociabilidad y expectativas. Más que un defecto del autoinforme, es la consecuencia honesta de pedirle a alguien que se resuma a sí mismo en un día concreto. Lo práctico es no hacer un test en mitad de una mala racha y leer el resultado de uno hecho así como una lectura de esa racha.

Si tengo varios resultados, ¿con cuál me quedo?

Con el hecho descansado, para un contexto declarado y en el instrumento más largo disponible. Si dos resultados discrepan y los dos se hicieron en condiciones razonables, la respuesta honesta es que la posición real está entre los dos y que ninguna de las dos etiquetas la está describiendo bien. Eso informa más que elegir la favorita.

¿Un test traducido mide lo mismo que el original?

Cuando la traducción se ha hecho con el procedimiento adecuado y se ha comprobado la equivalencia, bastante. El proyecto que adaptó el BFI-2 de forma coordinada a cinco idiomas encontró propiedades psicométricas muy comparables entre versiones. Lo que no garantiza nada es una traducción hecha sin ese trabajo, que es la situación de la mayoría de los tests gratuitos de internet, donde ni siquiera se publica quién tradujo ni cómo.

Míralo en tus propios números

Este artículo, aplicado a tu situación

Luna ha leído la misma investigación — y, si la dejas, tus resultados.

✦ Hablarlo con Luna

Más notas sobre las personas