← ナレッジベース
🔁

再検査信頼性

同じ検査を二回受けて同じ答えが出るかどうかは測定できる数字で、最初に聞く価値のある数字です。特性と型でその数字がどう違うのか、そしてなぜ型のほうが不安定なのか。

測定のしかた

再検査信頼性は、一つの問いへの答えです。同じ人が同じ検査を二回受けて、あいだに重要なことが何も起きていないとき、二つの結果はどれくらい似ているか。

二回のあいだの相関として報告されます。心理測定でいちばん地味な数字です。そして最初に探すべき数字でもあります。検査が主張する他のすべてが、これに依存しているからです。二週間で自分と食い違う測度は、あなたの安定した性質を測ることができていません。二週間のほうを測っています。

ここで最も重要な知見は、「性格診断は当てにならない」ではありません。特性得点は、人が思っているよりかなり安定しています。重要なのは、安定した得点の上に載せた型のほうが、得点よりずっと不安定だということ —— そして人気のある検査のほとんどが、型を渡して得点を隠すということです。

数字

おおよその値です。宣伝資料ではなく、公刊された信頼性研究から。

数週間にわたる特性尺度。 よく作られたビッグファイブの器具は、数週間で r = 0.80 前後、一年をまたいでも r = 0.70 の近くに留まります。高い値です。人の順位はほとんど変わらず、今日の得点は来月の得点への良い賭けだということを意味します。

数十年にわたる特性尺度。 ロバーツとデルヴェッキオは152件の縦断研究をメタ分析し、順位の一貫性が年齢とともに上がることを見つけました —— 児童期でおよそ r = 0.31、二十代で 0.54、50歳から70歳のあいだで約 0.74。パーソナリティは安定していて、次第により安定し、そして完全に固定されることはありません。最後の一点を、擁護派も批判派も同じように取り違えます。

数週間にわたる四文字の型。 ここで崩れます。ハウズとカースカドンが五週間の間隔で再検査したところ、四つの二分すべてで同じコードになった人は半数を下回りました。 個々の次元はおおむね60〜80パーセントの人で保たれますが、それを四回連続で要求するのは厳しい注文です。のちの数字は間隔と標本で変わり、公式マニュアル自身の数字も変わりますが、形は一貫していて、ピッテンガーの総説はこれを脚注ではなくこの器具の中心問題として扱っています。

この二つの事実は矛盾していません。背後の傾向は少ししか動きませんでした。型は大きく動きました。境目の上に載っていたからです。

なぜ型のほうが不安定なのか

機構は単純で、例一つで見えます。

思考–感情の得点が感情寄りに52パーセントだったとします。二週間後、悪い一週間ではなく良い一週間のあとに測ると、48。測定はほとんど動いていません —— どんな短い質問紙でも誤差の内側です。特性の基準でいえば、同じ値を二回読んだのと変わりません。

けれども文字は反転しました。F が T になった。ラベルが変わり、タイプ説明が変わり、人に言っている四文字が変わり、あなたについては何も変わっていません。

これを四回重ねます。型コードにはこの境目が四つあり、そのうち一つの近くにいるだけでコードは変わります。型の不安定さが尺度の不安定さよりはるかに高いのはそのためです。一つの測定が安定かを問うているのではなく、四つの独立した測定が四本の線の同じ側に留まるかを問うている。線がどこに落ちていて、人が実際どこに集まっているかは境目の問題にあります。

二つのことが出てきます。真ん中が最も信頼できない場所であり、ほとんどの人はそこにいます。 そして文字が変わったことは、たいてい人が変わったことではありません —— 境目付近の得点に起きる最もありふれた出来事であり、成長の証拠と読むのも、詐欺の証拠と読むのも、どちらも読みすぎです。

日本の「公式」は、この数字を前提にして設計されています

日本語で読む人には、再検査係数を探すより強い証拠が手元にあります。本家の運用が、先に答えを言っています。

日本MBTI協会が扱う MBTI® は、質問紙の結果を確定値として渡しません。 協会の説明では、回答結果はきっかけであり、それが本当に本人にフィットするかどうかを認定ユーザーの支援のもとで検証していく過程が中核です。受検者が自分で「ベストフィットタイプ」、つまり最もしっくりくるタイプを見つける。そして認定ユーザーには、対面でのフィードバックが倫理規程で義務づけられています。

この設計を、測定の側から読み直すとこうなります。質問紙一回の出力が、そのままその人の型だと言えるなら、この手続きは要りません。 印刷して渡せばいい。対面の検証工程が必要なのは、一回の出力が暫定だからです。協会がそう言葉にしているかどうかとは別に、手続きの形がそう言っています。

そして日本語圏で実際に流通している四文字は、この手続きを通っていません。無料のウェブ診断が数分で返した結果です。協会は 16Personalities について、質問も結果の出し方も MBTI とは別のものだと明言しています。両者の違いは無料の性格診断を比べるにまとめました。

つまり日本語圏の状況はこうです。検証工程を持っているほうは和名も普及も持っておらず、普及しているほうは検証工程を持っていない。 自分の四文字がどちらから来たのかを確認するのが、この項目でいちばん実用的な一歩です。

正当に得点を動かすもの

不安定さのすべてが雑音ではありません。一部は、検査が測るつもりのなかった実在の何かを正しく拾っています。

気分。 ハウズとカースカドンはこれを直接調べていて、二回のあいだで気分が動いた人ほど一致率が低くなりました。「ふだんどうふるまうか」を聞く質問紙は、いまどう感じているかから答えられます。手元にある証拠がそれだからです。

実施の文脈。 職場で、仕事のために答えるのと、家で自分のために答えるのとでは、応答が変わります。参照枠が変われば「ふだん」の意味が変わります。

比較集団。 人は自分を周りの人と比べて評定します。うるさい職場に移れば、行動が何も変わらなくても自己評定の外向性は下がります。文化をまたいで記録されている効果で、回答のくせで扱います。

状態の測度が動くのは失敗ではありません。 不安定であるべき器具もあります。読んでいるものが動くからです。ムード診断のような気分パターンの測度が、しんどい一週間に違う値を返すのは、器具が働いている証拠であって壊れている証拠ではありません。誤りは、状態の読み取りに特性の読み取りのふるまいを期待することのほうにあります。結果の変化を心配する前に、自分が受けたのがどちらだったかを確認してください。

本当の変化。 パーソナリティは動きます。ゆっくり、たいていは一方向に —— 人は二十代から三十代にかけて、誠実性と情緒的安定性が上がる傾向があります。五年あれば、差の一部は本物です。五週間なら、ほぼ何も本物ではありません。

実務上の規則。一か月あけた二回の差は測定です。数年にわたる、同じ方向への、文字ではなく尺度の上の差は、あなたかもしれません。

検査に何を要求するか —— 私たちのものも含めて

三つ、分かることの多い順に。

そもそも再検査の数字を公開しているか。 無料の検査のほとんどは公開していません。その不在自体が情報です —— 検査が必ず悪いからではなく、誰も確かめていないからです。信頼性の統計を一つも報告しない検査は、評価されることではなく信用されることを求めています。

ラベルだけでなく得点も返すか。 ラベル単体では、読者が安定性を確かめようがありません。四つのパーセンテージなら確かめられます —— 二回受けて、それぞれがどれだけ動いたかを見ればいい。ビッグファイブが受け直す対象として有用なのはこのためで、得点を側に変換しないので、反転するものが存在しません。

幅を見せるか、点を見せるか。 一つの数字は、短い質問紙が持っていない精度を含意します。

この基準で見ると、私たちの検査は出来にばらつきがあり、具体的に書いておく価値があります。MBTI風タイプ診断はコードの横に四つの次元をパーセンテージで出しています。50の近くにいる読者がそれに気づけるように、というのがそのままの理由です。そして36項目を四次元に割ると一次元あたり九項目で、これは短い測定であり、帯として読むべきものです。 再検査係数は公表していません。研究を実施していないからです。それは実在する欠落であり、インターネット上のほぼすべての無料検査が抱えているのと同じ欠落であり、よくあることだからといって小さくはなりません。

研究なしでも言えることが、このページの存在理由です。どれかの次元で真ん中付近にいるなら、結果は変わると思っておいてください。変化に意味を読まないでください。そして文字ではなくパーセンテージのほうを使ってください。

もう一つ、日本語圏に固有の忠告があります。安定した結果が出るまで受け直さないこと。 四文字が自己紹介欄や初対面の話題に載っている場所では、揺れている結果は言いにくく、はっきりした結果には社会的な実用があります。だから境目付近の人ほど、確定するまで受け直すほうへ強く引かれます。受け直しが選んでいるのは真実ではなく、運の良い一回です。 二回続けて真ん中付近なら、それが答えです。結果が毎回変わること自体については性格診断の結果が毎回変わる理由にも書きました。

出典

  • · Myers, I. B., McCaulley, M. H., Quenk, N. L., Hammer, A. L. (1998). MBTI Manual: A Guide to the Development and Use of the Myers-Briggs Type Indicator (3rd ed.). Consulting Psychologists Press.
  • · Howes, R. J., Carskadon, T. G. (1979). Test-retest reliabilities of the Myers-Briggs Type Indicator as a function of mood changes. Research in Psychological Type, 2(1), 67–72.
  • · Pittenger, D. J. (2005). Cautionary comments regarding the Myers-Briggs Type Indicator. Consulting Psychology Journal: Practice and Research, 57(3), 210–221.
  • · Roberts, B. W., DelVecchio, W. F. (2000). The rank-order consistency of personality traits from childhood to old age: A quantitative review of longitudinal studies. Psychological Bulletin, 126(1), 3–25.

ナレッジベースの他の項目