← ナレッジベース
🎚️

回答のくせ

同じ特性を持つ二人が、評定尺度の使い方だけで違う得点を出します。黙認、極端反応、社会的望ましさ、参照集団効果 —— そしてそのどれも、内側からは見えません。

測定のしかた

同じくらいよく話す二人がいます。一人は初めて会う人と話すのが好きだに五段階の五をつけます。もう一人は、同じだけよく話すのに、四をつけます。確信があることにしか五を使わないからです。

得点は違います。特性は違いません。 違うのは回答のくせ —— 何を評定しているかとは独立に、その人が評定尺度を使うときの習慣的なやり方です。

これは丸め誤差ではありません。ワイテルスらは、この習慣が質問紙をまたいでも時間をまたいでも個人の中で一貫していることを示しました。つまり、それ自体が特性のように振る舞います。 安定していて、個人差があって、測定できる。そして、くせはすべての項目に適用されるので、すべての尺度を同じ方向へ同時に動かします。 これが、いちばん厄介な形で見えなくします。回答のくせで歪んだプロフィールは、それでも整合したプロフィールに見えます。

いちばん居心地が悪いのは最後です。自分のくせは自分では見えません。 自分を「黙認しやすい回答者」として経験している人はいません。正直に答えている、と経験しています。そして実際、正直に答えています。

いちばん損害を出す四つ

黙認 —— 同意しやすさ。ある文に「はい」と答えて、その反対の文にも「はい」と答える人がいます。いい加減だからではなく、同意が最も抵抗の少ない道であり、たいていの文には何かしら真な部分があるからです。全項目を同じ向きで書いた検査は、黙認しやすい回答者と、本当にその特性を持つ人を区別できません。 よく作られた尺度が一部の項目を逆転させて採点するのはこのためで、逆転項目が一つも無い質問紙は小さな警告です。

極端反応と中間反応。 一と五に住んでいる人がいて、すべてを三と四に圧縮する人がいます。圧縮する側の得点はどの特性でも真ん中へ寄り、タイプ診断ではすべての境目の近くに同時に着地することになります。境目の問題(カットオフ)が記述している状況で、実際に特性が釣り合っているからではなく、くせが作った釣り合いです。

社会的望ましさに沿った回答。 単なる嘘ではありません。ポールハスがこれを二つの成分に分けていて、この区別が使える部分です。 印象管理 —— 見ている相手に向けて、より良い自分を意図的に提示すること。自己欺瞞的高揚 —— 正直だが膨らんだ自己像。前者は匿名性に反応します。後者はしません。答えている本人が自分の答えを信じているからです。 クラウンとマーロウが一般的な傾向を捕まえるために作った尺度は1960年から使われていて、いまもかなりの量を検出します。

参照集団効果。 最も直感に反していて、場面によっては最大です。人は、自分を取り巻いている人たちに対して自分を評定します。 ハイネらは、これが生のリッカート平均の文化間比較を壊すことを示しました。平均的な勤勉性が高い文化の成員は、勤勉性の高い同輩に対して自分を評定するので、国ごとの平均が行動指標と逆向きに出ることがあります。同じ仕組みが、もっと小さい規模でも走ります。転職して周りが変われば、習慣が何も変わらなくても自己評定の几帳面さは動きます。 同じ家に住んでいる相手を基準に自分を評定している、という形もごく普通にあり —— 二人で同じ質問紙に答えて結果を並べる場面については相性のほうに書きました。

日本語話者の標本で、繰り返し観察されていること

強制選択とリッカート尺度が、「どちらともいえない」という選択肢の側の話を扱って、回答者の側の話をこちらへ渡してきています。受け取ります。

*チェン、リー、スティーヴンソンが1995年に Psychological Science に出した研究が、いちばん直接的です。仙台の高校生944名、台北1,357名、カナダ(エドモントンとカルガリー)687名、米国(ミネアポリス圏とバージニア州フェアファックス郡)2,174名に、57個の七件法の尺度*に答えてもらいました。

結果は二つ。日本と台湾の生徒は、二つの北米の集団より中点を使いやすかった。 そして米国の生徒は、他の三集団より両端の値を使いやすかった。 さらに各文化の内部で、個人主義への支持が強いほど両端の使用が多く、中点の使用が少なくなっていました。

ハージングが2006年に26か国で行った調査も、東アジアの標本で極端な回答が少ないという同じ方向の結果を出しています。ハムラ、ハイネ、ポールハスは2008年に、弁証法的思考 —— 矛盾する二つの記述が両方成り立ちうるという考え方の強さ —— が中間回答の傾向を説明する変数になりうるという形で、仕組みの候補を出しました。「どちらとも言える」と本当に思っているなら、中点は逃げではなく正確な回答です。

ここから先が、この節でいちばん大事な部分です。 チェンらの論文は、この差について自分たちで但し書きを書いています。 差は小さく、統計的に有意ではあるものの、項目平均の文化間比較を一般に変えるものではなかった、と。

つまり、「日本人は中間を選ぶので性格診断の結果が当てにならない」は、この研究が支持している主張ではありません。 支持しているのはもっと狭いことです。集団の平均として、中点の使用にわずかな偏りがある。 それだけです。

三つ、はっきり書いておきます。

一つめ。これは集団の平均で、個人についての予測ではありません。 両端を遠慮なく使う日本語話者はいくらでもいます。あなたが中点に寄る人かどうかは、国籍からではなく、自分の回答用紙からしか分かりません。

二つめ。効果は小さい。 自分の結果が納得いかないときに「文化のせい」と言えるほどの大きさではありません。そう使われるなら、この知見は説明ではなく逃げ道になります。

三つめ。それでも実務的に効く場面が一つあります。プロフィール全体が中庸に見えるときです。どの特性も五十パーセント前後、どのタイプの境目にも近い —— その形は、本当に平均的な人が出す形でもあり、中点に寄る回答者が出す形でもあります。 二つを外から見分ける方法はありませんが、内側からなら一つあります。質問紙のどこかで、一と五を一度でも使ったかどうか。

なお、日本語話者の自己評定が全体に低めに出るという話は、中間回答傾向とは別の仕組みです。 自己高揚への動機づけの文化差については自己報告式の質問紙に見えるものが一節を割いているので、そちらに渡します。混ぜないほうがいい二つです。

その場で答えを動かすもの

くせは安定しています。文脈は安定していなくて、しかもくせの上に積み重なります。

誰が読むと思っているか。 同じ質問紙を、自分のために、治療者のために、雇用主のために答えると、三つのプロフィールが出ます。不正直ではありません。読み手が違えば、真実のうち関係する側面が違う、というだけです。

どの「自分」として答えているか。 几帳面かと訊かれて、仕事のことを答えているのか、家のことを答えているのか。多くの人は黙ってどちらかを選び、多くの質問紙はそれを指定しません。 職業場面で使われる器具が参照枠を明示するのはまさにこのためで、消費者向けの検査はほぼ明示しません。

直近性。 「どれくらいの頻度で怒りますか」は、集計からではなくいちばん鮮明な直近の一件から答えられます。悪い一週間は良い一週間と違うプロフィールを出し、受けるたびに結果が動く理由の大きな部分がこれです。

設問の順番と疲労。 長い質問紙の後半の答えは、前半より平坦で中点に近くなります。40項目ならこれは小さい。ゼロではありません。

共通方法分散。 ポッドサコフらが整理したのは、すべてを同じ人が同じ瞬間に同じ方法で測ったときに何が起きるかです。尺度間の相関が、共有された方法のぶん水増しされる。性格プロフィールに当てはめると、得点どうしの関係 —— つまりプロフィールの形で、解釈されるのはまさにそこ —— が最も汚染されている部分だということになります。

何ができるのか、そして効かなかった対処について

研究用の器具には部分的な対処があります。消費者向けの検査はほとんど使っていません。理由は技術ではなく商売のほうです。

逆転項目を入れる。 項目の半分を逆向きにして黙認を打ち消す。安上がりで効果があり、そして質問紙を繰り返しが多く、少し意地悪に感じさせるので、完走率を食います。

個人内で標準化する。 各人の答えをその人自身の平均と散らばりで標準化し、くせを取り除いてパターンを残す。効きます。そして個人間の比較可能性を壊します。 この取引は強制選択とリッカート尺度にあります。

強制選択。 同じくらい望ましい二つの文を戦わせると、印象管理はよく防げます。そして程度を捨てます。

妥当性尺度。 臨床の器具には、一貫しない回答、過剰な申告、防衛的態度を検出する尺度が入っていて、それに引っかかった回答を破棄します。 無料の検査でこれをやっているものはほとんどありません。「あなたの結果は破棄されました」は、商品として最悪の体験だからです。

項目を増やす。 特性あたりの項目が多いほど雑音が平均されます。そして離脱も増えます。

そして、効かなかった対処を一つ。 社会的望ましさの尺度で得点を補正する、という古典的な手続きがあります。クラウンとマーロウの尺度を一緒に取って、その分を差し引く。直感的にはもっともです。

うまくいきませんでした。 ワンズ、ヴィスウェスヴァランとライスが1996年に、採用場面での性格検査についてこれを大規模に検討し、社会的望ましさを統制しても、性格尺度の予測妥当性は改善しなかったと結論しています。論文の副題は "The red herring" —— 偽の手がかりです。

なぜ書くかというと、この項目の主題そのものだからです。回答のくせは実在します。実在することと、それを差し引けることは別です。 「望ましさを補正済み」と謳っている検査があったら、その補正が何かを改善したという証拠を、別に訊く必要があります。

くせがいちばん強く噛むのはスクリーニング形式の設問群で、帯の境目は他のどんな境目とも同じように振る舞うからです。中点に寄る回答者は、同じ体験をしている極端反応の回答者より、不安チェックで丸ごと一段低い帯に着地しうる。そのページが得点の出るところすべてに「診断ではありません」と書いている理由の一部がこれです。

取引の形に注目してください。どの補正も、項目か、時間か、比較可能性を代償にします。 無料のウェブ検査は完走率のために最適化されているので、どの取引でも反対側を取ります。 陰謀ではなく誘因で、どの誘因がその器具を作ったかが分かれば、その得点が何を支えられるかはだいたい分かります。

これを踏まえて自分の結果を読む

実務的な調整を三つと、私たちの検査についての正直な話を一つ。

プロフィール全体が中庸なら、自分が平凡だと結論する前に、尺度の使い方を疑う。 平坦なプロフィールは、実際の中庸と同じくらいの頻度で中間反応から出ます。確かめ方は簡単です。質問紙のどこかで一と五を使ったかどうかを見る。

プロフィール全体が良い感じなら、もう一度見る。 自己欺瞞的高揚は内側からは検出できません —— それが定義です。 そして補正は内省ではなく、人に訊くことです。他人の評定が何を足すのか、どこで自分より当たるのかは自己報告式の質問紙に見えるものに書きました。

形は慎重に、高さより順序を読む。 くせは全部を一緒に膨らませたりしぼませたりするので、プロフィール全体がずれていても、いちばん高い尺度はたぶんいちばん高いままです。 水準が生き延びないところで、順序は生き延びます。

私たちについて。逆転項目を全体にわたって使っている検査はありません。妥当性尺度を持っている検査もありません。始める前に参照枠を指定させる検査もありません。 ビッグファイブは五特性に30項目 —— 特性あたり六項目で、どの基準から見ても短い測定であり、くせが効く余地はたっぷり残っています。生の得点ではなくパーセンテージで報告しているのは解釈の助けになりますが、この問題には何もしていません。

この影響を減らした結果が欲しいなら、同じ検査を二週間あけて違う気分のときに二回受けて、どちらか一方ではなく重なりのほうを読んでください。 そして二回が大きく違ったなら、動いたもののほうを測っているのがムーディーテストです。

出典

  • · Paulhus, D. L. (1984). Two-component models of socially desirable responding. Journal of Personality and Social Psychology, 46(3), 598–609.
  • · Crowne, D. P., Marlowe, D. (1960). A new scale of social desirability independent of psychopathology. Journal of Consulting Psychology, 24(4), 349–354.
  • · Ones, D. S., Viswesvaran, C., Reiss, A. D. (1996). Role of social desirability in personality testing for personnel selection: The red herring. Journal of Applied Psychology, 81(6), 660–679.
  • · Weijters, B., Geuens, M., Schillewaert, N. (2010). The individual consistency of acquiescence and extreme response style in self-report questionnaires. Applied Psychological Measurement, 34(2), 105–121.
  • · Chen, C., Lee, S., Stevenson, H. W. (1995). Response style and cross-cultural comparisons of rating scales among East Asian and North American students. Psychological Science, 6(3), 170–175.
  • · Hamamura, T., Heine, S. J., Paulhus, D. L. (2008). Cultural differences in response styles: The role of dialectical thinking. Personality and Individual Differences, 44(4), 932–942.
  • · Harzing, A.-W. (2006). Response styles in cross-national survey research: A 26-country study. International Journal of Cross Cultural Management, 6(2), 243–266.
  • · Heine, S. J., Lehman, D. R., Peng, K., Greenholtz, J. (2002). What's wrong with cross-cultural comparisons of subjective Likert scales? The reference-group effect. Journal of Personality and Social Psychology, 82(6), 903–918.
  • · Podsakoff, P. M., MacKenzie, S. B., Lee, J.-Y., Podsakoff, N. P. (2003). Common method biases in behavioral research: A critical review of the literature and recommended remedies. Journal of Applied Psychology, 88(5), 879–903.

ナレッジベースの他の項目