Los tests gratuitos y la evaluación formal
Qué compras con unos cientos de euros cuando la versión gratuita hace preguntas parecidas. No exactitud: un baremo, un manual, alguien cualificado que responda y un registro. Y cuándo nada de eso vale la pena.
Cómo medimos
Una evaluación de personalidad hecha por un psicólogo cuesta, en consulta privada, del orden de unos cientos de euros. Una gratuita en una web hace preguntas reconociblemente parecidas y se acaba en seis minutos.
La explicación obvia es que la de pago es exacta y la gratuita no. Es mayormente falsa, y merece la pena decirlo en un sitio que regala tests.
Lo que se paga no es exactitud. Es que alguien responda. Un manual publicado, un baremo documentado, una persona cualificada para interpretar la salida y responsable de lo que dice, y un registro que sigue existiendo al día siguiente. Son bienes reales con precios reales. Ninguno de ellos es lo mismo que el cuestionario sea mejor leyéndote.
Mientras tanto, un test gratuito puede estar construido sobre ítems de dominio público con décadas de investigación detrás y dejarte igualmente sin nada que hacer con el resultado —— porque los ítems nunca fueron la parte escasa.
Lo que compra el dinero de verdad
Cinco cosas, y conviene saber cuál te importa antes de decidir.
Un baremo que puedes nombrar. Un instrumento formal informa de tu puntuación contra un grupo de comparación documentado: cuántas personas, reclutadas cómo, de dónde, cuándo. Un test gratuito te compara, como mucho, con quien haya pasado por esa web, que es una muestra autoseleccionada de gente que hizo clic en un enlace. La aritmética del percentil es idéntica; el significado no, por las razones que expone la entrada de percentiles y baremos.
Hay aquí una comprobación de diez segundos que solo funciona bien en castellano. Busca la palabra «baremo» en la página del test. En el oficio en español es vocabulario corriente —— un manual profesional abre con los baremos, y las editoriales publican tablas separadas por sexo, edad y contexto ——, y las webs de tests gratuitos no la pronuncian prácticamente nunca. No porque la escondan: porque no tienen ninguno.
Un manual. Coeficientes de fiabilidad, estudios de validez, el uso previsto, las poblaciones en las que se validó, y los usos que el editor desaconseja de forma expresa. Aburrido, y es el documento que permite a cualquiera comprobar las afirmaciones. Un test sin manual no es necesariamente malo: es que no está auditado.
Alguien cualificado que interprete. La diferencia más grande, y la que más se infravalora. Un profesional formado lee tu perfil en el contexto de tu historia, te dice qué puntuaciones ignorar, se fija en la contradicción entre dos escalas, y responde profesionalmente de lo que afirma. Una página de resultados no puede hacer nada de eso: tiene un solo guion para todo el que caiga en esa puntuación.
Distribución restringida. Los instrumentos serios se venden solo a compradores cualificados, lo que mantiene los ítems fuera de circulación y evita que los baremos se degraden. Un test cuyos ítems están en internet es un test para el que la gente se puede preparar.
Un registro. Algo que existe después, que se puede revisar y que puede entrar en un proceso: un plan de desarrollo, una decisión de selección, una formulación clínica. Un resultado gratuito es una pantalla que cierras.
Lo que no compra el dinero
Tres cosas que la gente da por hecho que están al otro lado del muro y no están.
Ítems mejores. Los bancos de ítems de dominio público son genuinamente buenos. Goldberg y colegas construyeron el IPIP precisamente para que existieran libremente escalas que midieran los mismos constructos que los instrumentos propietarios, y las versiones IPIP correlacionan fuerte con sus equivalentes comerciales. Una escala gratuita de los cinco grandes bien hecha no está midiendo algo más basto: está midiendo prácticamente lo mismo sin licencia.
Que lo online sea un defecto. Buchanan y Smith lo miraron pronto y encontraron que las medidas de personalidad administradas por web se comportaban muy parecido a las de papel, con estructura y fiabilidad comparables. Internet no es el problema. Veinticinco años de investigación posterior lo han confirmado a grandes rasgos, y las directrices de la ITC sobre evaluación por internet tratan de supervisión, seguridad y equidad, no de que el medio sea peor en sí.
Inmunidad a los límites generales. Una evaluación de pago sigue siendo un autoinforme, sigue estando moldeada por los estilos de respuesta, y sigue informando de efectos reales y pequeños. Pagar no mueve el techo del método. Un consultor seguro de sí mismo con un informe caro puede sobrepasarse bastante más de lo que se sobrepasa una página de resultados, y la factura hace más difícil discutírselo.
Una cuarta, específica del castellano: pagar tampoco garantiza que el instrumento esté adaptado y no solo traducido. La diferencia entre las dos cosas tiene su propia literatura en español —— las directrices de Muñiz, Elosua y Hambleton —— y está explicada en la entrada sobre la validez. Es una pregunta legítima que hacerle a quien te va a pasar la prueba.
En español el muro no es el precio, es la licencia
Esta es la parte donde la comparación inglesa no se puede trasladar tal cual, y cambia la decisión que tienes delante.
En inglés, la página compara dos productos que un lector podría comprar: un test gratuito o una evaluación cara. En España el segundo no está a la venta para ti. Las editoriales que publican instrumentos profesionales —— TEA Ediciones, hoy dentro del grupo Hogrefe, y las equivalentes —— clasifican su catálogo por niveles de cualificación, y el nivel que cubre los tests de personalidad exige titulación universitaria en Psicología o disciplina afín, o estar cursando el último año. No es una barrera de precio: es una barrera de acreditación, y no se salta pagando más.
La consecuencia práctica es que la elección no es entre un test barato y un test caro. Es entre un producto y una persona. Lo que contratas cuando pagas es a un profesional colegiado que decide qué instrumento pasarte, lo corrige contra sus baremos y firma lo que concluye. El cuestionario va dentro, como el material va dentro de una obra.
Y hay una auditoría pública que en inglés no tiene equivalente directo. Para los tests editados en España, la Comisión de Tests del Consejo General de la Psicología evalúa periódicamente las pruebas con un modelo de revisión propio y publica los informes, y la calidad de los baremos es una de las dimensiones puntuadas; la entrada de fiabilidad test-retest cuenta cómo funciona. Lo que importa aquí es lo que esa lista implica por omisión: ningún test gratuito de internet ha entrado nunca en ella, en ningún idioma. No es que lo suspendan. Es que no se presentan.
En América Latina el cuadro cambia otra vez. El catálogo editorial y las reglas de colegiación son distintos país por país, el mercado de evaluación profesional es más desigual, y muchos instrumentos circulan con baremos españoles o argentinos aplicados a poblaciones que no son ninguna de las dos. Si vas a pagar una evaluación, la pregunta concreta y educada es con qué baremo se va a corregir y de qué país y de qué año es. Un profesional serio la contesta sin incomodarse; que no haya respuesta es información.
Y antes de nada: si lo que quieres es simplemente hacer un buen test gratuito en castellano, la parte difícil es que muchos no existen en tu idioma. Eso está comprobado sitio por sitio en la comparativa de tests de personalidad gratuitos, con la conclusión incómoda de que para algunos modelos no queda ninguna opción gratuita en español.
Cuándo pagar y cuándo no
Paga cuando una decisión tiene consecuencias para otra persona. Selección, promoción, cualquier cosa donde alguien se ve afectado por el resultado y podría razonablemente preguntar sobre qué base. Los Standards for Educational and Psychological Testing existen para este caso, y un test de internet sin validar usado para decidir una contratación es indefendible y, en varias jurisdicciones, ilegal.
Paga cuando la pregunta es clínica. Malestar, funcionamiento, si algo es un trastorno. Las herramientas de cribado indican; no diagnostican, y lo que hay en medio de las dos cosas es una evaluación cualificada.
Paga cuando lo que quieres es la persona más que la puntuación. Muchas veces el valor está entero en la conversación. En ese caso estás comprando un par de horas estructuradas con alguien formado, y el cuestionario es el guion, no el producto.
No pagues por curiosidad. Si la pregunta es hacia qué extremo de un rasgo caes, una escala gratuita decente lo contesta casi igual de bien y además puedes repetirla.
No pagues por un certificado. Una administración de pago del MBTI es un servicio real y no hace que el código de cuatro letras sea más estable que el de la versión gratuita —— la nuestra incluida: nuestro test de dieciséis tipos tiene la misma inestabilidad de frontera que el de pago. La inestabilidad está en el punto de corte, no en el proveedor.
No pagues para zanjar una discusión. Ningún instrumento tiene autoridad suficiente para terminar un desacuerdo sobre cómo es alguien, y tratarlo como si la tuviera es el fallo que describe el esencialismo psicológico.
Dónde estamos nosotros
Regalamos tests y vendemos una suscripción alrededor de lo que viene después, así que tenemos un interés evidente en que creas que los tests gratuitos bastan. Esta es la versión que le daríamos a un amigo.
Nuestros tests no son evaluaciones formales y no los presentamos como equivalentes. No hay manual publicado de ninguno. No hemos hecho estudios de validación propios. Nuestro baremo es la gente que hizo el test en esta web, que es una muestra autoseleccionada y que además respondió mayoritariamente en inglés, de modo que a un lector hispanohablante le llega un percentil comparado contra un grupo que no es el suyo —— el mecanismo está en la entrada sobre los estilos de respuesta. Léelos como una ubicación aproximada, no como un estadístico poblacional.
Son cortos. Nuestro test de intereses profesionales está construido sobre el modelo RIASEC, que es el mismo marco que usan los inventarios vocacionales establecidos —— y 36 ítems no son una evaluación vocacional, y no vamos a decir que lo sean. Nuestro test de los cinco grandes tiene 30 ítems para cinco rasgos; el estándar de investigación va de 60 a 240 ítems, y la diferencia compra resolución por facetas que nosotros no podemos ofrecer. Nuestro test de alta sensibilidad tiene 15 ítems donde la escala de Aron tiene 27. Un test más corto tiene bandas de error más anchas, y eso es un coste directo del formato, no un detalle.
Y están en castellano por traducción, no por adaptación. Es la distinción del apartado anterior aplicada a nosotros mismos: nuestros ítems se escribieron en inglés y se pasaron al español, y no hemos comprobado que se comporten igual aquí.
Los bancos de estilo cribado son cribados. Dicen «esto no es un diagnóstico» donde aparece cada puntuación, y esa línea está trabajando de verdad.
En lo que creemos que sí somos buenos es en la capa posterior al número: conectar dos resultados, poner el hallazgo en un lenguaje que sirva un martes, y ser explícitos sobre lo que una puntuación no puede sostener —— que es para lo que existe esta sección entera de la base de conocimiento. Eso es un producto legítimo y no sustituye a una evaluación cuando lo que necesitas es una evaluación.
Si estás decidiendo entre nosotros y una evaluación formal, la pregunta es la de la entrada sobre la validez: ¿qué vas a concluir a partir del resultado? Si la conclusión afecta a un puesto, a un diagnóstico o a otra persona, paga a alguien. Si lo que buscas es mejor vocabulario para algo que llevas tiempo sin saber describir, un test gratuito y una página honesta sobre sus límites te llevan casi todo el camino.
fuentes
- · American Educational Research Association, American Psychological Association, National Council on Measurement in Education (2014). Standards for Educational and Psychological Testing. AERA.
- · International Test Commission (2005). International Guidelines on Computer-Based and Internet-Delivered Testing. ITC.
- · Goldberg, L. R., Johnson, J. A., Eber, H. W., Hogan, R., Ashton, M. C., Cloninger, C. R., Gough, H. G. (2006). The international personality item pool and the future of public-domain personality measures. Journal of Research in Personality, 40(1), 84–96.
- · Buchanan, T., Smith, J. L. (1999). Using the Internet for psychological research: Personality testing on the World Wide Web. British Journal of Psychology, 90(1), 125–144.
- · Muñiz, J., Elosua, P., Hambleton, R. K. (2013). Directrices para la traducción y adaptación de los tests: segunda edición. Psicothema, 25(2), 151–157.
- · Hernández, A., Ponsoda, V., Muñiz, J., Prieto, G., Elosua, P. (2016). Revisión del modelo para evaluar la calidad de los tests utilizados en España. Papeles del Psicólogo, 37(3), 192–197.
Más de la base de conocimiento
Conflicto y reparación
Hallazgos de la era Gottman sobre qué predice que una relación dure.
🔬Comprendiendo las Raíces de la Teoría de la Personalidad
Los fundamentos de la teoría de la personalidad revelan que la naturaleza humana es a la vez estructurada y fluida — guiada por la biología, moldeada por la cultura y refinada a través de la experiencia. Desde el inconsciente de Freud hasta los modelos cognitivos y de rasgos modernos, cada teoría aporta una pieza al rompecabezas de la individualidad.
🔬La Escuela Psicoanalítica - La Estructura Motivacional Inconsciente
Explica la estructura dinámica inconsciente de Freud, abarcando los niveles de conciencia y el ello, el yo y el superyó, mostrando cómo el inconsciente moldea la personalidad y el comportamiento.