← Base de conocimiento
🔘

Elección forzosa y escalas Likert

Que un test te pida elegir entre A y B, o que te pida puntuar una frase del uno al cinco, decide qué clase de resultado puede darte —— y uno de los dos formatos fabrica las categorías que después presenta como hallazgos.

Cómo medimos

Dos maneras de preguntar lo mismo.

En una fiesta, ¿tú (a) hablas con mucha gente, desconocidos incluidos, o (b) hablas con unos pocos a los que ya conoces?

«Empiezo conversaciones con gente que no conozco.» Muy en desacuerdo — en desacuerdo — ni de acuerdo ni en desacuerdo — de acuerdo — muy de acuerdo.

La primera es elección forzosa. La segunda es una escala Likert, por Rensis Likert, que propuso el formato en 1932. Parecen alternativas de estilo. No lo son. El formato decide qué clase de resultado es capaz de producir el test, antes de que se haya escrito una sola pregunta.

La versión corta: la elección forzosa tira el grado, y un sistema que ha tirado el grado solo puede informar de un bando. Si alguna vez te has preguntado por qué los tests de tipos producen tipos y los de rasgos producen porcentajes, esta es casi toda la respuesta. Las categorías no se descubrieron en los datos. Estaban montadas en la hoja de respuestas.

Qué conserva cada formato

Likert conserva la distancia. Quien está muy de acuerdo y quien está levemente de acuerdo han dicho cosas distintas, y la puntuación preserva la diferencia. Veinte ítems sumados dan una puntuación con muchos valores posibles, que después se puede situar contra un grupo de comparación —— la maquinaria de percentiles y baremos. También hace decible el medio: ni de acuerdo ni en desacuerdo es una respuesta real, y para alguien genuinamente intermedio es la exacta.

La elección forzosa conserva la dirección. Elegiste a. El test registra a. Si lo elegiste al 51 por ciento o al 99 no queda registrado, porque no se preguntó. Veinte ítems producen un recuento sobre veinte, y el recuento de cada persona cae a un lado o al otro de diez.

Eso tiene una ventaja genuina, que es la razón de que el formato persista. La elección forzosa es más difícil de falsear en una dirección, porque las dos opciones se construyen igual de atractivas. Si estás contestando para quedar bien ante una empresa, una escala de cinco puntos te deja estar muy de acuerdo con todo lo halagador; un ítem de A o B entre dos frases igual de deseables, no. Para selección de alto riesgo eso importa, y es la razón de que los instrumentos ocupacionales bien diseñados sigan usando el formato.

El coste es que una persona sin preferencia real está obligada a inventarse una. Veinte preferencias inventadas hacen un tipo.

Por qué un par traducido deja de estar igualado

Aquí hay un problema que solo aparece cuando el instrumento cambia de idioma, y que casi ninguna web que vende un test traducido menciona.

Vuelve a la ventaja del apartado anterior. La elección forzosa resiste la gestión de la impresión porque las dos frases de cada par están igualadas en deseabilidad social. Ese emparejamiento no es una casualidad: se construye, se pilota y se comprueba con muestras, y sin él el formato no protege de nada, porque el candidato simplemente elige la opción que queda mejor.

Y la deseabilidad social es específica de una lengua y de una cultura. Dos frases perfectamente equilibradas en inglés —— pongamos una sobre decir lo que se piensa sin rodeos y otra sobre cuidar cómo le sienta a la gente —— no tienen por qué estar equilibradas en castellano, ni tener el mismo equilibrio en Madrid y en Bogotá. Traducir el par conserva el significado y no conserva el emparejamiento, que es la propiedad que justificaba el formato.

Las directrices internacionales para la traducción y adaptación de tests, publicadas en español por Muñiz, Elosua y Hambleton, exigen justamente este tipo de comprobación: una adaptación no es una traducción, es un instrumento nuevo del que hay que aportar evidencia otra vez. Un cuestionario ipsativo que llegó al español pasando los ítems por un traductor ha perdido en silencio su única ventaja y ha conservado todos sus inconvenientes, y el informe sale igual de bonito.

Un detalle de vocabulario que agrava esto: en español «ipsativo» existe en los manuales de psicometría y no aparece jamás en un informe comercial. El lector que recibe un perfil de cuatro letras o de cuatro colores recibe el problema sin ninguna palabra con la que señalarlo.

El problema ipsativo

La elección forzosa arrastra una segunda consecuencia, menos obvia, nombrada por Cattell en 1944 y desarrollada en detalle por Hicks.

Cuando cada ítem te obliga a elegir entre dos rasgos, los rasgos compiten por un presupuesto fijo. Puntuar alto en uno implica necesariamente haber puntuado más bajo en otro, porque la misma respuesta hizo los dos trabajos. Eso es puntuación ipsativa: el resultado describe el orden de tus rasgos dentro de ti, no tu posición respecto a otras personas.

La consecuencia es cruda y se ignora de forma rutinaria. Las puntuaciones ipsativas no se pueden comparar entre personas. «Yo soy alto en dominancia y tú bajo» no es una frase que los datos sostengan, porque los dos gastasteis el mismo presupuesto fijo. Puedes decir que la dominancia es lo más alto tuyo; no puedes decir que es más alta que la de otro. Dos candidatos con perfiles idénticos pueden comportarse de forma completamente distinta, y dos con perfiles opuestos pueden ser idénticos en términos absolutos.

Por eso un perfil DISC es una forma y no una altura, y por eso el uso sensato de uno es una conversación sobre tu propio orden y no una comparación dentro de un equipo. Brown y Maydeu-Olivares mostraron que el problema es técnicamente resoluble —— los modelos de respuesta al ítem pueden recuperar puntuaciones normativas a partir de datos de elección forzosa ——, pero la solución exige un diseño concreto y una muestra de calibración, y casi nada de lo que puedes hacer gratis en internet tiene ninguna de las dos.

Dónde falla Likert, y qué dicen las anclas

El formato que conserva más información también recoge más ruido, y no es la opción obviamente mejor.

El medio se vuelve un escondite. El punto central se usa para el genuinamente intermedio, para el no lo sé, para el depende, para el prefiero no decirlo y para el no estoy leyendo con atención. Cinco estados distintos colapsan en una respuesta, que es la razón de que algunos instrumentos eliminen el punto medio y fuercen una inclinación —— reintroduciendo el problema de la elección forzosa en miniatura.

Y en español el punto medio ni siquiera se llama igual. Las adaptaciones usan ni de acuerdo ni en desacuerdo, indiferente y a veces como si fueran intercambiables, y no lo son: «indiferente» dice que el asunto no te importa, no que estés en el medio. Alguien profundamente interesado y exactamente equilibrado no debería marcar «indiferente», y lo marca porque es la única casilla central que hay.

Esto no es una minucia de redacción. Benítez y colegas compararon a españoles y neerlandeses y encontraron que los españoles respondían de forma más extrema en escalas de acuerdo, pero que el patrón se invertía en escalas de frecuencia que incluían «nunca» como ancla. Es decir: cambiar las etiquetas de respuesta cambió quién parecía extremo. La palabra impresa debajo de la casilla forma parte del instrumento tanto como el ítem.

El estilo contamina el contenido. Hay quien evita los extremos de cualquier escala y quien vive en ellos. Esa tendencia es estable dentro de una persona y desplaza sus puntuaciones en todos los rasgos a la vez, que es el tema de los estilos de respuesta.

El ancla es tu propio grupo de referencia. Estar de acuerdo con que eres hablador significa hablador comparado con quién. La gente contesta contra la gente que tiene alrededor, así que la misma conducta produce valoraciones distintas en entornos distintos.

La redacción del ítem hace más trabajo del que parece. Empiezo conversaciones con desconocidos y me resulta fácil empezar conversaciones con desconocidos miden cosas distintas. Una es conducta y la otra es dificultad percibida, y mucha gente contesta distinto a las dos.

Cómo leer un resultado cuando sabes el formato

Mira el formato de respuesta antes de mirar el resultado. Se tarda una pantalla y te dice qué puede significar la salida.

Si era A o B, la salida es una forma y una dirección. No la leas como una cantidad, no compares tu perfil con el de otra persona como si los dos estuvieran medidos con la misma regla, y espera que las etiquetas sean inestables —— una preferencia del cincuenta y uno por ciento registrada como un bando es exactamente la situación en la que falla la fiabilidad test-retest.

Si era del uno al cinco, la salida es una puntuación y solo significa algo contra un grupo de comparación. Pregunta cuál era el grupo. Un percentil calculado contra quien pasó por una web no es el mismo objeto que uno calculado contra una muestra estratificada.

Si el resultado es una categoría y el formato era una escala, alguien trazó una raya, y la raya es la parte menos fiable de lo que te han contado. Busca el número de debajo si la página lo enseña.

Nuestros tests usan los dos formatos, y la correspondencia no es casual: los cinco grandes son Likert e informan de porcentajes, el perfil DISC se acerca a lo ipsativo e informa de una forma, y el test de estilo MBTI informa de porcentajes junto a las cuatro letras precisamente para que el grado descartado siga visible en alguna parte. Donde un resultado nuestro te dé una etiqueta y ningún número, la etiqueta está cargando más peso del que el formato de debajo puede sostener, y conviene leerla como la afirmación más débil de la página.

fuentes

  • · Likert, R. (1932). A technique for the measurement of attitudes. Archives of Psychology, 140, 1–55.
  • · Cattell, R. B. (1944). Psychological measurement: normative, ipsative, interactive. Psychological Review, 51(5), 292–303.
  • · Hicks, L. E. (1970). Some properties of ipsative, normative, and forced-choice normative measures. Psychological Bulletin, 74(3), 167–184.
  • · Brown, A., Maydeu-Olivares, A. (2013). How IRT can solve problems of ipsative data in forced-choice questionnaires. Psychological Methods, 18(1), 36–52.
  • · Muñiz, J., Elosua, P., Hambleton, R. K. (2013). Directrices para la traducción y adaptación de los tests: segunda edición. Psicothema, 25(2), 151–157.
  • · Benítez, I., He, J., Van de Vijver, F. J. R., Padilla, J. (2016). Linking extreme response style to response processes: A cross-cultural mixed methods approach. International Journal of Psychology, 51(6), 464–473.

Más de la base de conocimiento