採点された予測の記録を維持する
明示的な確率をつけて予測を記録し、それが解決したときに採点する。
Why it works
キャリブレーションにはフィードバックループが必要です。確率を述べ、結果が起こり、述べた自信が自分の予測の基準率と一致していたかどうかを学びます。記録し採点することなしには、自信は測定可能な量ではなく感覚のままです。ブライアスコアは標準的な指標です。低いほど良く、確信を持った正しい予測に報い、確信を持った間違った予測に比例してペナルティを課します。
How to do it
- シンプルな記録を設定する。日付、質問、確率の推定値、結果(解決したとき)。
- キャリブレーション分析に十分なデータを生成するため、月に少なくとも5〜10件の予測を記録する。
- 解決した各予測を、ブライアスコアの公式で採点する:(確率 − 結果)²。結果は0か1。
- 時間をかけてブライアスコアをプロットする――スコアが低くなる傾向は本物の改善である。
エビデンス
テトロックの予測トーナメントは全体を通じてブライアスコアリングを使用しました。追跡され採点された予測者は、フィードバックなしで予測した人よりも有意に改善しました。採点メカニズムはキャリブレーションフィードバックの操作化であり、優れた判断力研究プログラムの中心です。 (observational)
個人の予測記録には維持する規律が必要であり、十分な量――一般的にきめ細かいキャリブレーションには数百の予測――があって初めて統計的に意味を持ちます。
出典
- Tetlock (2005), Expert Political Judgment
- Tetlock & Gardner (2015), Superforecasting
- Tetlock, P. E. (2005). Expert Political Judgment: How Good Is It? How Can We Know? Princeton University Press.
- Mellers, B., Stone, E., Atanasov, P., Rohrbaugh, N., Metz, S. E., Ungar, L., Bishop, M. M., Horowitz, M., Merkle, E., & Tetlock, P. (2015). The psychology of intelligence analysis: Drivers of prediction accuracy in world politics. Journal of Experimental Psychology: Applied, 21(1), 1–14.
- Brier, G. W. (1950). Verification of forecasts expressed in terms of probability. Monthly Weather Review, 78(1), 1–3.
よくある間違い
曖昧な言葉(『うまくいくと思う』)で予測を記録し、数値的な確率を使わないこと――これは採点を不可能にし、キャリブレーションを測定不能にします。
IX Coach でこれを実践する
More practices for キャリブレーション・トレーニング
- 信頼区間の推定を練習する
事実に関する量の範囲を推定し、真の値がその範囲内に収まる頻度を確認する。
- 自分が最も過信している具体的な領域を特定する
キャリブレーションは領域固有である――自信が正確さを最も超えている場所を見つける。
- 直感ではなく基準率に自信レベルを固定する
自信の推定値を、感じている自信からではなく、このタイプの予測の歴史的な的中率から始める。
- 予測をする前に解決基準に事前コミットする
結果が起こる前に、何が『自分は正しかった』と数えるかを正確に定義する。
- 低リスクのトリビアと年鑑の質問でキャリブレーションの反復練習を積む
事実に関するトリビアの質問をキャリブレーションの練習の場として使う。結果は即座に解決し、リスクはゼロである。
- 不確実性(定量化可能)と無知(定量化不可能)を区別する
確率を割り当てられるときと、状況があまりにも新しく数字が捏造されたものになるときを知る。