Los estilos de respuesta
Dos personas con el mismo rasgo pueden producir puntuaciones distintas por cómo usan una escala. Aquiescencia, respuesta extrema, deseabilidad social y efecto del grupo de referencia —— y por qué en español esto no es un tecnicismo.
Cómo medimos
Dos personas hablan lo mismo. Una puntúa disfruto conociendo gente nueva con un cinco sobre cinco; la otra, que vive al mismo nivel de sociabilidad, lo puntúa con un cuatro, porque reserva los cincos para las cosas de las que está segura.
Las puntuaciones difieren. El rasgo no. Lo que difiere es el estilo de respuesta: la forma habitual en que una persona usa una escala de valoración, con independencia de qué se esté valorando.
Esto no es un error de redondeo. Weijters y colegas mostraron que estos hábitos son consistentes dentro de una persona a través de distintos cuestionarios y a lo largo del tiempo, lo que significa que se comportan como rasgos por derecho propio: estables, individuales y medibles. Y como un estilo se aplica a todos los ítems, desplaza todas las escalas a la vez en la misma dirección, cosa que lo vuelve invisible justo de la manera que importa. Un perfil torcido por el estilo de respuesta sigue pareciendo un perfil coherente.
La parte incómoda es la última: no puedes ver el tuyo. Nadie se experimenta a sí mismo como un respondiente aquiescente. Se experimenta contestando con honestidad, cosa que está haciendo.
Las cuatro que hacen más daño
Aquiescencia —— la tendencia a estar de acuerdo. Hay quien dice que sí a una frase y después también a su contraria, no por descuido sino porque asentir es el camino de menor resistencia y casi toda frase tiene algo de verdad dentro. Un test que redacta todos sus ítems en la misma dirección no puede distinguir a un respondiente aquiescente de alguien que de verdad tiene el rasgo. Por eso las escalas bien construidas invierten la puntuación de algunos ítems, y por eso un cuestionario sin ningún ítem invertido es una señal de alarma pequeña.
Respuesta extrema frente a respuesta central. Hay quien vive en el uno y el cinco; hay quien lo comprime todo en el tres y el cuatro. Las puntuaciones de quien comprime gravitan hacia el medio en todos los rasgos, lo que en un test de tipos significa caer cerca de todos los límites a la vez —— la situación que describe el problema del punto de corte, producida por un estilo y no por un equilibrio real de rasgos.
Respuesta socialmente deseable. No es simplemente mentir. Paulhus la separó en dos componentes, y la distinción es la parte útil: la gestión de la impresión, presentación deliberada de una versión mejor ante un público, y el autoengaño positivo, la visión de uno mismo honesta pero inflada. El primero responde al anonimato. El segundo no, porque quien contesta se cree sus respuestas. La escala de Crowne y Marlowe, construida para detectar la tendencia general, está en uso desde 1960 y sigue capturando mucha.
El efecto del grupo de referencia. El más contraintuitivo y, en algunos contextos, el mayor. Te puntúas frente a la gente que te rodea. Heine y colegas mostraron que esto destroza las comparaciones transculturales de medias Likert crudas: los miembros de una cultura con responsabilidad media alta se puntúan frente a iguales de responsabilidad alta, así que las medias nacionales pueden salir del revés respecto a los indicadores conductuales. El mismo mecanismo funciona a escala pequeña. Cambia de equipo y tu organización autopercibida se mueve sin que tus hábitos hayan cambiado nada.
Esto le pasa más a quien lee esta página en español
Aquí es donde la entrada deja de ser un tecnicismo. La investigación transcultural lleva treinta años encontrando que los estilos de respuesta no se reparten por igual entre países, y que los hispanohablantes están en el lado alto de la balanza. Conviene verlo con las cifras y con sus límites, porque de aquí sale una consecuencia práctica.
Poblaciones latinas: más respuesta extrema y más aquiescencia. Marín, Gamba y Marín encontraron en 1992 que los respondientes hispanos usaban los extremos de la escala y asentían con más frecuencia que los no hispanos, y añadieron dos matices que se citan menos de lo que deberían: el efecto disminuía con la aculturación y disminuía con los años de estudio. La revisión sistemática de Zolopa, Leon y Rasmussen de 2024 reunió los estudios disponibles y encontró el mismo patrón de forma bastante consistente —— respuesta extrema en diecisiete de ellos, aquiescencia en diez, deseabilidad social en cinco.
El sur de Europa tampoco responde como el norte. Van Herk, Poortinga y Verhallen compararon muestras representativas de seis países de la Unión Europea y encontraron que la aquiescencia y la respuesta extrema estaban más presentes en el Mediterráneo —— Grecia, Italia y España —— que en el noroeste europeo. Y no lo dedujeron solo de la forma de las distribuciones: lo contrastaron con estadísticas de consumo nacionales y con conducta declarada, y las discrepancias iban en la dirección esperada.
España y América Latina no son el mismo caso, y ahí está el matiz bueno. Benítez, He, Van de Vijver y Padilla compararon España con los Países Bajos con un diseño mixto, cuantitativo y de entrevistas cognitivas. Los españoles respondieron de forma más extrema en escalas de acuerdo, donde se pide adhesión a una frase. Pero en escalas de frecuencia que incluían «nunca» como ancla el patrón se invirtió. O sea: el estilo no es una propiedad fija de un país, es una interacción entre la persona y el formato concreto de la escala. Un hallazgo que se repite con «muy de acuerdo» puede desaparecer o darse la vuelta con «nunca / a veces / siempre».
A escala global, el patrón regional aguanta. El estudio de 26 países de Harzing sitúa a los países del sur de Europa y a la mayoría de los latinoamericanos en el lado alto de la aquiescencia, con los países del este de Asia en el bajo. Johnson, Kulesa, Cho y Shavitt, con unos 18.000 cuestionarios de 19 países, encontraron que la distancia al poder y la masculinidad de Hofstede se asociaban de forma positiva e independiente con la respuesta extrema.
Y ahora los límites, porque sin ellos esto se convierte en una caricatura. Buena parte del trabajo sobre «latinos» es trabajo sobre hispanos residentes en Estados Unidos, contestando en un contexto de minoría y a menudo en su segundo idioma, y no sobre una persona en Monterrey o en Rosario. La aculturación y los años de estudio explican una porción del efecto, lo que sugiere que parte de lo que se mide como estilo cultural es estilo educativo. Los tamaños son modestos y la variación dentro de cualquiera de estos grupos es mucho mayor que la diferencia entre ellos. Nada de esto permite predecir cómo contestas tú, y si esta sección se lee como si sí, se está leyendo mal.
Lo que sí permite es entender una práctica del sector que de otro modo parece burocracia: las editoriales de tests que operan en español publican baremos latinoamericanos aparte de los españoles. No es marketing regional. Es el reconocimiento de que una puntuación directa no significa lo mismo a los dos lados del Atlántico, y de que compararte contra la muestra equivocada te mueve el percentil sin que tú te hayas movido. La entrada sobre percentiles y baremos explica de dónde sale el grupo de comparación; esta explica por qué el tuyo importa tanto.
De ahí la consecuencia comercial, que es la que te afecta hoy: los percentiles de un test gratuito de internet salen de quien pasó por esa web, que contestó mayoritariamente en inglés. Al lector hispanohablante le llega un número torcido dos veces —— por su propio estilo de respuesta y por el baremo ajeno contra el que se lo comparan ——, y ninguna de las dos torceduras aparece en la pantalla del resultado. La nuestra incluida.
Qué mueve una respuesta en el momento
El estilo es estable. El contexto no, y se apila encima.
Quién crees que va a leerlo. El mismo cuestionario contestado para ti, para un terapeuta y para una empresa da tres perfiles. No es deshonestidad: un público distinto hace relevante un aspecto distinto de la verdad.
Qué «tú» estás contestando. Si te preguntan si eres organizado, ¿estás contestando sobre el trabajo o sobre tu casa? Casi todo el mundo elige uno en silencio, y casi ningún cuestionario lo especifica. Los instrumentos que se usan en contextos laborales añaden un marco de referencia justo por esto, y los tests de consumo casi nunca.
Lo reciente. «Con qué frecuencia pierdes los nervios» se contesta desde el último episodio vívido, no desde un recuento. Una mala semana produce un perfil distinto de una buena, y eso explica buena parte de que los resultados se muevan entre sesiones.
Orden de las preguntas y fatiga. Las respuestas del final de un cuestionario largo son más planas y más cercanas al punto medio que las del principio. En un test de 40 ítems esto es pequeño. No es cero.
Varianza de método común. Podsakoff y colegas catalogaron lo que pasa cuando todo se mide de la misma forma, en el mismo momento y por la misma persona: las correlaciones entre escalas quedan infladas por el método compartido. Aplicado a un perfil de personalidad, significa que las relaciones entre tus puntuaciones —— la forma del perfil, que es lo que se interpreta —— son la parte más contaminada.
Qué se puede hacer al respecto
Los instrumentos de investigación tienen arreglos parciales. Los tests de consumo no usan casi ninguno, y las razones son comerciales y no técnicas.
Redacción equilibrada. Invertir la mitad de los ítems para que la aquiescencia se cancele. Barato, eficaz, y hace que un cuestionario resulte repetitivo y un poco desconfiado, lo que cuesta finalizaciones.
Ipsatizar dentro de la persona. Tipificar las respuestas de cada uno contra su propia media y su propia dispersión, quitando el estilo y conservando el patrón. Funciona, y destruye la comparabilidad entre personas —— el intercambio que describe elección forzosa y escalas Likert.
Elección forzosa. Enfrentar dos frases igual de deseables derrota bastante bien a la gestión de la impresión. También tira el grado a la basura.
Escalas de validez. Los instrumentos clínicos incluyen escalas que detectan respuestas inconsistentes, sobreafirmación y defensividad, y descartan un protocolo que las suspende. Casi ningún test gratuito hace esto, porque decirle a un usuario que su resultado se ha descartado es una mala experiencia de producto.
Escalas más largas. Más ítems por rasgo promedian más ruido. También más abandono.
Los cuestionarios de tipo cribado son donde esto muerde más fuerte, porque el límite de una banda se comporta como cualquier otro punto de corte. Alguien que responde hacia el centro puede caer una banda entera por debajo en el test de ansiedad que alguien con la misma experiencia que responde en los extremos, y esa es parte de la razón de que esa página diga «no es un diagnóstico» allí donde aparece una puntuación.
Fíjate en la forma de cada intercambio: toda corrección cuesta ítems, tiempo o comparabilidad. Un test gratuito optimiza para que lo termines, así que toma el otro lado de cada uno. No es una conspiración, es un incentivo, y saber qué incentivo construyó el instrumento te dice casi todo lo que necesitas sobre cuánto pueden cargar sus puntuaciones.
Leer tu propio resultado con esto en la cabeza
Tres ajustes prácticos, y una franqueza sobre nuestros tests.
Si tu perfil entero es mediocre, sospecha de tu uso de la escala antes de concluir que eres poco destacable. Un perfil plano lo produce tan a menudo la respuesta central como la moderación real. La comprobación es fácil: mira si usaste el uno y el cinco en algún sitio del cuestionario.
Si tu perfil entero es halagador, míralo otra vez. El autoengaño positivo no es detectable desde dentro —— esa es su definición ——, y la corrección no es introspección, es preguntar a alguien. La entrada sobre el autoinforme cubre qué añaden las valoraciones de otras personas y dónde te ganan.
Lee la forma, con cuidado, y el orden relativo más que las alturas absolutas. El estilo infla o desinfla todo junto, así que tu escala más alta probablemente siga siendo tu escala más alta aunque el perfil entero esté desplazado. El orden sobrevive a lo que los niveles no.
Y en cuanto a nosotros: ninguno de nuestros tests usa redacción equilibrada en todo el cuestionario, ninguno lleva escalas de validez, y ninguno te pide que especifiques un marco de referencia antes de empezar. Nuestro test de los cinco grandes tiene 30 ítems para cinco rasgos —— seis ítems por rasgo, que es una medición corta con cualquier criterio y deja sitio de sobra para que el estilo importe. Informamos de porcentajes en vez de puntuaciones directas, lo que ayuda a la interpretación y no hace nada contra este problema. Y nuestro baremo es la gente que hizo el test en esta web, mayoritariamente en inglés, que después de todo lo anterior es una advertencia concreta y no una fórmula.
Si quieres un resultado menos expuesto a esto, haz el mismo test dos veces con quince días y estados de ánimo distintos y lee el solapamiento en vez de cualquiera de las dos sesiones —— y si las dos sesiones difieren mucho, el Moody Test está midiendo eso que se movió.
fuentes
- · Paulhus, D. L. (1984). Two-component models of socially desirable responding. Journal of Personality and Social Psychology, 46(3), 598–609.
- · Crowne, D. P., Marlowe, D. (1960). A new scale of social desirability independent of psychopathology. Journal of Consulting Psychology, 24(4), 349–354.
- · Weijters, B., Geuens, M., Schillewaert, N. (2010). The individual consistency of acquiescence and extreme response style in self-report questionnaires. Applied Psychological Measurement, 34(2), 105–121.
- · Heine, S. J., Lehman, D. R., Peng, K., Greenholtz, J. (2002). What's wrong with cross-cultural comparisons of subjective Likert scales? The reference-group effect. Journal of Personality and Social Psychology, 82(6), 903–918.
- · Podsakoff, P. M., MacKenzie, S. B., Lee, J.-Y., Podsakoff, N. P. (2003). Common method biases in behavioral research: A critical review of the literature and recommended remedies. Journal of Applied Psychology, 88(5), 879–903.
- · Marín, G., Gamba, R. J., Marín, B. V. (1992). Extreme response style and acquiescence among Hispanics: The role of acculturation and education. Journal of Cross-Cultural Psychology, 23(4), 498–509.
- · van Herk, H., Poortinga, Y. H., Verhallen, T. M. M. (2004). Response styles in rating scales: Evidence of method bias in data from six EU countries. Journal of Cross-Cultural Psychology, 35(3), 346–360.
- · Johnson, T., Kulesa, P., Cho, Y. I., Shavitt, S. (2005). The relation between culture and response styles: Evidence from 19 countries. Journal of Cross-Cultural Psychology, 36(2), 264–277.
- · Harzing, A.-W. (2006). Response styles in cross-national survey research: A 26-country study. International Journal of Cross Cultural Management, 6(2), 243–266.
- · Benítez, I., He, J., Van de Vijver, F. J. R., Padilla, J. (2016). Linking extreme response style to response processes: A cross-cultural mixed methods approach. International Journal of Psychology, 51(6), 464–473.
- · Zolopa, C., Leon, M., Rasmussen, A. (2024). A systematic review of response styles among Latinx populations. Assessment, 31(4), 947–962.
Más de la base de conocimiento
Conflicto y reparación
Hallazgos de la era Gottman sobre qué predice que una relación dure.
🔬Comprendiendo las Raíces de la Teoría de la Personalidad
Los fundamentos de la teoría de la personalidad revelan que la naturaleza humana es a la vez estructurada y fluida — guiada por la biología, moldeada por la cultura y refinada a través de la experiencia. Desde el inconsciente de Freud hasta los modelos cognitivos y de rasgos modernos, cada teoría aporta una pieza al rompecabezas de la individualidad.
🔬La Escuela Psicoanalítica - La Estructura Motivacional Inconsciente
Explica la estructura dinámica inconsciente de Freud, abarcando los niveles de conciencia y el ello, el yo y el superyó, mostrando cómo el inconsciente moldea la personalidad y el comportamiento.