Dua jaminan probabilitas yang berbeda

Laboratorium ini memakai model

\[X\mid p\sim\operatorname{Binomial}(20,p).\]

Analisis Bayesian menetapkan prior \(p\sim\operatorname{Beta}(2,2)\). Setelah \(X=x\), distribusi posteriornya adalah

\[p\mid X=x\sim\operatorname{Beta}(x+2,22-x).\]

Selang kredibel 95% berekor sama \(C_B(x)=[L_B(x),U_B(x)]\) menyisihkan peluang posterior 0,025 pada masing-masing ekor. Pernyataan \(P\{p\in C_B(x)\mid X=x\}=0{,}95\) memperlakukan \(x\) sebagai data yang sudah diamati dan \(p\) sebagai peubah acak dalam model posterior; lihat Inferensi Bayesian sebagai pembaruan dan keputusan yang koheren dan Perbandingan Bayesian–frekuentis: keputusan, cakupan, dan kalibrasi.

Pembanding frekuentis adalah selang kepercayaan dua sisi Clopper–Pearson 95%, \(C_F(x)=[L_F(x),U_F(x)]\), yang membalik uji ekor binomial eksak. Untuk \(x=0,\ldots,20\), titik ujungnya—termasuk pada kasus batas—didefinisikan oleh

\[L_F(x)= \begin{cases} 0,&x=0,\\ Q_{\operatorname{Beta}(x,21-x)}(0{,}025),&1\le x\le20, \end{cases}\]

dan

\[U_F(x)= \begin{cases} Q_{\operatorname{Beta}(x+1,20-x)}(0{,}975),&0\le x\le19,\\ 1,&x=20. \end{cases}\]

Pernyataan cakupannya memperlakukan \(p\) sebagai tetap dan \(X\) sebagai acak:

\[C_F(p)=P_p\{p\in C_F(X)\}.\]

Kemiripan bentuk dua pasang titik ujung itu tidak menyamakan makna probabilitasnya.

Kontrak komputasi

Generator kanonis adalah simulations/run_c3_simulations.py. Ia memakai:

Karena kedua parameter distribusi beta di sini selalu berupa bilangan bulat positif, generator menghitung fungsi distribusi beta dengan identitas jumlah berhingga

\[I_z(a,b)=\sum_{j=a}^{a+b-1} {a+b-1\choose j}z^j(1-z)^{a+b-1-j}.\]

Kuantil dihitung dengan membalik fungsi distribusi melalui tepat 80 langkah biseksi. Nilai ringkasan diserialkan sebagai untai desimal berpresisi tetap setelah dikuantisasi, sehingga perbedaan yang tidak relevan pada digit titik-mengambang terakhir tidak mengubah byte CSV atau catatan bukti.

Cakupan untuk nilai parameter pembangkit yang tetap

Untuk setiap \(p\) pada kisi, peluang binomial dijumlahkan, bukan hanya diperkirakan:

\[C_B(p)=\sum_{x=0}^{20} {20\choose x}p^x(1-p)^{20-x}\, \mathbf 1\{p\in C_B(x)\},\]

dan rumus yang sama dipakai untuk \(C_F(p)\). Tabel berikut menampilkan beberapa titik representatif; kolom “eksak” berasal dari jumlah berhingga tersebut.

Cakupan bersyarat pada parameter tetap; 80.000 replikasi per baris hanya memeriksa implementasi
\(p\) tetapKredibel, eksakKredibel, Monte CarloClopper–Pearson, eksakClopper–Pearson, Monte Carlo
0,010,0000000,0000000,9831410,983688
0,020,6676080,6688000,9929310,993488
0,050,9245160,9253500,9840980,984425
0,100,8670470,8664630,9887470,988150
0,250,9559040,9551130,9618230,961675
0,430,9783320,9785130,9783320,978513
0,500,9586110,9594380,9586110,959438

Prior simetris dan model binomial menghasilkan kurva simetris terhadap \(p=0{,}5\). Karena itu baris untuk \(0{,}75\), \(0{,}90\), \(0{,}95\), \(0{,}98\), dan \(0{,}99\) mempunyai cakupan eksak yang sama dengan baris pasangannya di atas. Di seluruh 99 titik, cakupan selang kredibel minimum adalah 0 pada \(p=0{,}01\) dan \(0{,}99\), sedangkan maksimumnya 0,9783319525, yang pertama kali dicapai pada \(p=0{,}43\). Cakupan Clopper–Pearson minimum pada kisi adalah 0,9586105347, dicapai pertama kali pada \(p=0{,}50\).

Kurva cakupan bersyarat pada kisi p dari 0,01 sampai 0,99: garis penuh untuk selang kredibel Beta(2,2) berubah tajam dan bernilai nol di kedua ujung kisi, sedangkan garis putus-putus untuk selang Clopper–Pearson tetap sedikit di atas garis sasaran 0,95.
Cakupan pada parameter tetap bukan peluang posterior setelah data diamati.

Data untuk seluruh kisi: CSV cakupan bersyarat.

Mengapa cakupan nol di \(p=0{,}01\) bukan kontradiksi

Jika \(x=0\), selang kredibel adalah \([0{,}010709966038;\,0{,}219486607453]\). Nilai tetap \(p=0{,}01\) berada di bawah titik ujung kiri itu. Untuk \(x>0\), titik ujung kiri bahkan lebih besar. Akibatnya, tidak ada nilai data yang mungkin menghasilkan selang yang memuat \(p=0{,}01\), sehingga cakupannya tepat nol. Namun setiap selang yang telah dihitung tetap memuat tepat 95% massa posteriornya sendiri. Kedua fakta itu menjawab pertanyaan probabilitas yang berbeda.

Sebagai pembanding, pada \(x=0\) selang Clopper–Pearson adalah \([0;\,0{,}168433470983]\) dan memuat \(p=0{,}01\). Pada \(x=10\), selang kredibel adalah \([0{,}305878001491;\,0{,}694121998509]\), sedangkan selang Clopper–Pearson adalah \([0{,}271957849561;\,0{,}728042150439]\). Prior Beta(2,2) menarik selang posterior menjauhi batas; prior lain akan memberi titik ujung serta profil cakupan lain. Laboratorium ini tidak menyatakan bahwa satu pilihan prior berlaku universal.

Data titik ujung: CSV semua selang.

Identitas kalibrasi rataan terhadap prior

Misalkan \(m(x)\) adalah peluang prior-prediktif. Dengan hukum probabilitas total dan aturan Bayes,

\[\begin{aligned} \int_0^1 C_B(p)\,\pi(p)\,dp &=\sum_{x=0}^{20}\int_{C_B(x)} P(X=x\mid p)\pi(p)\,dp\\ &=\sum_{x=0}^{20}m(x) \int_{C_B(x)}\pi(p\mid x)\,dp\\ &=0{,}95\sum_{x=0}^{20}m(x)=0{,}95. \end{aligned}\]

Ini merupakan identitas model gabungan: mula-mula \(p\) acak mengikuti distribusi Beta(2,2), lalu \(X\) acak bersyarat pada \(p\). Perhitungan berhingga memberi jumlah peluang prior-prediktif 1,000000000000 dan cakupan selang kredibel yang dirata-ratakan terhadap prior 0,950000000000. Simulasi 500.000 pasangan menghasilkan 0,950392000000.

Selang Clopper–Pearson mempunyai cakupan yang dirata-ratakan terhadap prior sebesar 0,973876917134 pada model gabungan yang sama; simulasinya memberi 0,974138000000. Nilai lebih tinggi itu mencerminkan konservatisme akibat data diskret, bukan probabilitas posterior 0,9739 setelah satu nilai \(x\) diamati.

Apa yang boleh dan tidak boleh disimpulkan

Pemeriksaan dan pemutaran ulang

Semua pemeriksaan berikut lulus: setiap selang memiliki titik ujung yang terurut; selisih massa posterior setiap selang kredibel dari 0,95 kurang dari \(5\times10^{-13}\); jumlah peluang prior-prediktif sama dengan satu; selisih mutlak antara ruas kiri identitas rataan terhadap prior dan 0,95 kurang dari \(5\times10^{-13}\); cakupan Clopper–Pearson tidak kurang dari 0,95 pada seluruh titik kisi; serta simetri kedua kurva terjaga hingga \(5\times10^{-13}\). Selisih absolut Monte Carlo maksimum terhadap hasil penjumlahan eksak di 99 titik adalah 0,002279528245 untuk selang kredibel dan 0,001611006822 untuk Clopper–Pearson, keduanya di bawah batas pemeriksaan 0,008.

Jalankan python simulations/run_c3_simulations.py --write, lalu python simulations/run_c3_simulations.py --check-only. Mode kedua menghitung ulang seluruh keluaran dan menghentikan proses dengan status gagal bila inventaris, byte, manifes, atau catatan bukti berubah. Ringkasan metrik tersedia pada CSV kalibrasi.