条件付き独立性はグラフィカルモデルや因果推論 等で必須となる統計的知識である。ただ、定義だけ学んでもいまいち感覚がつかめないところがあった。文献 [1], [2] にわかりやすい具体例を見つけたため、自分なりにまとめてみる。
まずは確率変数の独立の定義を見てみよう。2つの離散の確率変数 と
が独立であるとは、斯様に定義される。
\begin{equation} X⫫Y ≝ P(X = x, Y = y) = P(X = x) P(Y = y)~\textrm{for all}~x, y. \end{equation}
上の定義は以下のようにも書き換えられる。
\begin{equation} X ⫫ Y ≝ P(X = x \mid Y = y) = P(X = x) \end{equation} \begin{equation} \textrm{for all}~y~\textrm{such that}~P(Y = y) > 0. \end{equation}
つまり、片方 () の情報が、もう片方 (
) の情報に寄与しないことを意味する。
具体例を挙げよう。確率変数をいくつか定義する。
:自分の腕時計が壊れているときに1、そうでないときに0を取る確率変数。
:友人が街頭インタビューを受けているときに1、そうでないときに0を取る確率変数。
直感的にこの二変数は独立だと考えられるだろう(まさか、自分の腕時計が壊れていても、友人が街頭インタビューを受ける確率は変わらないだろうし、逆もまた然り)。つまり、 だ。
ここで、独立とは別の概念として条件付き独立がある。定義を確認しよう。3つの離散の確率変数 と
、
が、
について条件付き独立であるとは、斯様に定義される。
\begin{equation} X ⫫ Y \mid Z ≝ P(X = x, Y = y\mid Z = z) = P(X = x\mid Z = z)P(Y = y\mid Z= z) \end{equation} \begin{equation} \textrm{for all}~x,y,z~\textrm{such that}~P(Z = z) > 0. \end{equation} 独立の時のように、以下のようにも書き換えられる。
\begin{equation} X ⫫ Y \mid Z ≝ P(X = x \mid Y = y, Z = z) = P(X = x\mid Z= z) \end{equation} \begin{equation} \textrm{for all}~x,y,z~\textrm{such that}~P(Y = y, Z = z) > 0. \end{equation}
つまり、既に を知っているときに
の追加の情報が
の情報に関して役に立たないことを意味する。
独立だからと言って、条件付けても独立であるとは限らない。そのようになる例を、引き続き先ほどの具体例を使って説明しよう(文献 [1] を参考にして作成した)。追加の確率変数を定義する。
:自分と友人が待ち合わせをしており、うまく合流できたときに1、どちらかが遅れた時に0を取る確率変数。
腕時計と街頭インタビューの確率が待ち合わせの確率にそれぞれ影響を与えるのは以下のようにして確認できる。 は独立ではないことを表す。
:自分の腕時計が壊れていたときは、待ち合わせがうまくいく可能性は低いだろう。つまり、
となるため独立でない。
:友人がインタビューを受けていると、友人は待ち合わせに遅れる確率が高まるだろう。つまり、
となるため独立でない。
今、不思議なことに待ち合わせの結果で条件づけると腕時計とインタビューの結果は独立でなくなる。これは以下のようにして確認できる。 は条件付き独立ではないことを表す。
:待ち合わせ時間に来ない友人はもしかしたら街頭インタビューを受けていたかもしれないと突飛に考えたとする。そんなことを思っているうちにふと、自分の腕時計と近くの時計を比べて腕時計が大幅に遅れていたと気付いた。そうなると友人が街頭インタビューを受けたなどという可能性はより低くなるだろう。なぜなら、自分の腕時計が壊れていたせいで、実は自分が遅れていて、先についていた友人はあきれて帰ってしまったという説明のほうがもっともらしいからだ。つまり、
であり、腕時計の情報がインタビューの確率に影響を与えるため、条件付けると独立ではない。逆の例の方がより自然かもしれない。待ち合わせに遅れたら、自分の腕時計がずれている可能性をかなり高い確率で疑う。暇だったため待ち合わせ場所の近くにあるテレビを見ると、街頭インタビューを受けている友人がリアルタイムで映っている。待ち合わせできない理由が判明したも同然で、呆れ返ってもはや自分の腕時計が壊れているとは疑いもしないであろう。
変数間の統計的関係性を図示すると図1のようになる。このような有向グラフは統計的性質のみ表現する図と考える場合(弱めの仮定)と、厳密な因果関係を表す図(強めの仮定)と考える場合があるが、今回は後者(つまり前者の解釈も成り立つ)で考えてもらいたい。つまり、 は
と
に依存している。

だが、
となる確率変数の因果関係の例。
上の例と同じ結果になる別の例も紹介しておく。(なんともいい加減だが)自分と友人がそれぞれの家でコイントスを投げ、表が出たときだけ待ち合わせに向かうとする。先の記号に寄せて、自分と友人のコインの出方の変数をそれぞれ と
とし、表か裏を取るとする。当然コインの出方は独立のため、
である。ここで、待ち合わせが上手くいかない時を考えると、それはどちらか一方もしくは両方が裏を出したときとなる。待ち合わせの結果で条件付けるともはやコイントスの結果は独立でなくなる。式で表すと、
より、
となる。
次に、今までの例とは違い、条件付けがないときは独立でないが、条件づけられたら独立になる例 [2] (図2)を紹介する。今、コース料理として、ドリンクとメインディッシュ、デザートを順に食す。ビールと言えば肉料理!肉料理を食べたらお腹が膨れるからデザートはサラダ!のように料理は他の料理との組み合わせで、図2のように選択確率が変わるとする。ただし、各料理のオーダーは前の順番に出された料理にのみ依存して決まるとする。それぞれのメニューを確率変数 、
、
として表すと、図2のような選択確率では、ドリンクによって最後のデザートの確率が変わるため、ドリンクとデザートは独立でない。式で表すと、
より、
となる。一方で、メインディッシュの選択が既知となると、デザートの選択はもはやドリンクに依存せず、ドリンクの選択もデザートに依存しなくなるため、
となる。

だが、
となる確率変数の因果関係の例。文献 [2] 参考。
コース料理の例の他にも、条件付けると独立になる関係性がある。疑似相関の有名な以下の誤った推論がそれに当てはまる。
「アイスクリームの売り上げとプールでの溺死事故の相関が高い!アイスクリームが溺死を引き起こしている?」
結論としては夏の熱波という隠れた要素がアイスの売り上げと水難事故に影響していたという落ちである。今、アイスの売り上げと水難事故の発生件数、気温を確率変数として考え、それぞれ 、
、
とする。たしかに、気温が未知で季節の情報もないうえでは、アイスの売り上げと水難事故の発生件数だけを比べた場合お互いに相関があるように見えるため、
である。ただし、気温が既知で夏だと分かった上でさらにアイスの売買の情報を知っても水難事故に関する情報はもはや得られず、逆も然りなため気温で条件づけると独立
となる。このような関係は図3のように表される。

だが、
となる確率変数の因果関係の例。
その他の話題を少しだけ述べる。上の図で示した3つの関係性は条件付き独立における基礎的な関係性である。有向グラフィカルモデルにおいて、変数間の条件付き独立性を見つける有向分離と呼ばれる方法があり、これら3つが重要な要素として登場する。統計は容易に誤謬を招くが、バークソンのパラドックスやシンプソンのパラドックスなどは条件付けや選択によって生じる代表的な誤謬の例であり、潜在的な変数に気を付けないといけない。
独立かどうかは、条件、言い換えれば文脈によって変わりうるということだ。なにか意味ある結果が生まれたとき、変わったのは世界そのものではなく、私たちの見方なのかもしれない。
参考文献
[1] L. Wasserman, "All of statistics: a concise course in statistical inference." Springer Science & Business Media, 2004.
[2] M. Maathuis et al., "Handbook of graphical models." CRC Press, 2018.