Set penguasaan 02 — estimasi, bias, MSE, dan sifat penduga
Gunakan bias sebagai \(E_\theta[T]-\theta\), varians sebagai penyebaran di bawah parameter tetap, dan risiko kuadrat sebagai \(R(\theta,T)=E_\theta[(T-\theta)^2]\). Ketiga besaran itu tidak boleh dicampur dengan hasil dari satu sampel atau dengan hasil komputasi tanpa distribusi pengambilan sampel yang mendasarinya.
Masalah 1 — bias dan MSE rataan berbobot
Misalkan \(X_1,\ldots,X_n\) saling bebas dan berdistribusi identik (iid) dengan \(E[X_i]=\mu\) dan \(\operatorname{Var}(X_i)=\sigma^2<\infty\). Untuk konstanta \(c\) dan nilai acuan \(\mu_0\) yang diketahui, pertimbangkan
- Turunkan bias dan varians \(T_c\).
- Tulis MSE sebagai fungsi \(c,\mu,\mu_0,\sigma^2,n\).
- Untuk \(\mu=\mu_0\), tentukan \(c\) yang meminimalkan MSE; bandingkan dengan \(c=1\).
Petunjuk 1
Gunakan \(E[\bar X]=\mu\) dan \(\operatorname{Var}(\bar X)=\sigma^2/n\). Suku konstan \((1-c)\mu_0\) tidak menambah varians.
Petunjuk 2
Bias adalah \((1-c)(\mu_0-\mu)\). MSE selalu sama dengan varians ditambah kuadrat bias, sehingga saat \(\mu=\mu_0\) cukup meminimalkan \(c^2\sigma^2/n\).
Jawaban singkat
\(T_c\) memiliki bias \((1-c)(\mu_0-\mu)\) dan varians \(c^2\sigma^2/n\), dan
Jika \(\mu=\mu_0\), pilihan \(c=0\) mempunyai MSE nol karena nilai acuan tepat; \(c=1\) mempunyai MSE \(\sigma^2/n\).
Solusi lengkap
Linearitas ekspektasi memberi
sehingga bias terhadap target \(\mu\) adalah
Karena hanya bagian \(c\bar X\) acak,
Definisi MSE dan identitas bias-varians menghasilkan
Jika nilai acuan memang sama dengan parameter, \(\mu_0=\mu\), bias hilang untuk semua \(c\), tetapi varians paling kecil pada \(c=0\), yaitu penduga konstan \(T_0=\mu_0\) yang sudah mengetahui target. Penduga rataan biasa \(T_1\) lalu memiliki MSE \(\sigma^2/n\). Dalam praktik \(\mu_0\) sering hanya tebakan, sehingga pengurangan varians harus dipertimbangkan bersama bias; tidak ada pilihan \(c\) yang unggul untuk semua nilai \(\mu\) tanpa menetapkan ruang parameter atau kerugian.
Masalah 2 — varians sampel dengan penyebut \(n\) atau \(n-1\)
Ambil \(X_1,\ldots,X_5\) iid \(N(\mu,\sigma^2)\) dengan \(\sigma^2=4\). Definisikan
- Hitung \(E[S_n^2]\), biasnya, dan MSE-nya.
- Tunjukkan bahwa \(S^2\) tak bias dan hitung variansnya.
- Jelaskan sumber derajat bebas empat.
Petunjuk 1
Untuk sampel Normal, \(\sum_i(X_i-\bar X)^2/\sigma^2\sim\chi^2_{n-1}\). Gunakan rataan dan varians khi-kuadrat tersebut.
Petunjuk 2
Jika \(V\sim\chi^2_4\), maka \(E[V]=4\) dan \(\operatorname{Var}(V)=8\). Tulis kedua penduga sebagai kelipatan \(V\) dengan \(\sigma^2=4\).
Jawaban singkat
\(E[S_n^2]=16/5\), bias \(-4/5\), dan \(\operatorname{MSE}(S_n^2)=144/25\). Penduga \(S^2\) tak bias dengan \(\operatorname{Var}(S^2)=2\sigma^4/(n-1)=8\). Derajat bebas empat muncul karena satu kendala linear dari sisaan, yaitu jumlah sisaan nol.
Solusi lengkap
Tuliskan \(V=\sum_{i=1}^5(X_i-\bar X)^2/\sigma^2\). Teori sampel Normal memberi \(V\sim\chi^2_4\). Dengan \(\sigma^2=4\),
Karena \(E[V]=4\), \(E[S_n^2]=16/5\), sehingga biasnya \(16/5-4=-4/5\). Variansnya
MSE menambahkan kuadrat bias:
Untuk \(S^2\), \(E[S^2]=E[V]=4=\sigma^2\), jadi tak bias, dan \(\operatorname{Var}(S^2)=\operatorname{Var}(V)=8\), sama dengan rumus \(2\sigma^4/(n-1)=2(16)/4\). Sisaan memenuhi \(\sum_i(X_i-\bar X)=0\), satu kendala yang menghapus satu arah dari lima dimensi data; itulah sebabnya jumlah kuadrat memiliki empat derajat bebas.
Masalah 3 — penyusutan dan risiko kuadrat
Misalkan \(\bar X\sim N(\mu,v)\) dengan \(v=\sigma^2/n\) diketahui dan \(|\mu|\le M\). Pertimbangkan \(T_a=a\bar X\) untuk \(0\le a\le1\).
- Turunkan risiko kuadrat \(R(\mu,a)\).
- Tentukan \(a\) yang meminimalkan risiko terburuk \(\sup_{|\mu|\le M}R(\mu,a)\).
- Bandingkan hasilnya dengan penduga tak bias \(a=1\) dan jelaskan kapan penyusutan dapat menguntungkan.
Petunjuk 1
Bias \(T_a\) adalah \((a-1)\mu\) dan variansnya \(a^2v\). Untuk \(0\le a\le1\), risiko meningkat terhadap \(\mu^2\), sehingga supremum terjadi pada \(|\mu|=M\).
Petunjuk 2
Diferensiasikan \((1-a)^2M^2+a^2v\) terhadap \(a\) dan setarakan dengan nol. Periksa bahwa turunan kedua positif.
Jawaban singkat
Risiko terburuk adalah \((1-a)^2M^2+a^2v\), dengan minimum dalam kelas \(T_a=a\bar X\) pada \(a^*=M^2/(M^2+v)\). Penduga \(a=1\) berisiko konstan \(v\); penyusutan linear menurunkan risiko terburuk menjadi \(M^2v/(M^2+v)\) dengan menerima bias. Ini bukan klaim minimaks global.
Solusi lengkap
Di bawah \(\mu\), ekspektasi \(T_a\) adalah \(a\mu\), sehingga biasnya \((a-1)\mu\). Varians \(a\bar X\) adalah \(a^2v\). Identitas risiko-bias-varians memberi
Untuk \(0\le a\le1\), koefisien \((1-a)^2\) nonnegatif, jadi risiko maksimum pada ruang \(|\mu|\le M\) tercapai saat \(\mu^2=M^2\):
Turunan pertama adalah \(-2(1-a)M^2+2av\). Menyetarakannya dengan nol menghasilkan
dan turunan kedua \(2(M^2+v)>0\). Dengan substitusi, \(R_{\max}(a^*)=M^2v/(M^2+v)\). Penduga tak bias \(a=1\) mempunyai risiko \(v\), sehingga penyusutan lebih baik daripada \(a=1\) dan meminimalkan risiko terburuk di dalam kelas linear \(T_a=a\bar X\), \(0\le a\le1\). Ini bukan klaim minimaks global: memotong \(a^*\bar X\) ke interval \([-M,M]\) tidak pernah memperbesar galat kuadrat untuk \(|\mu|\le M\) dan memperkecil risiko secara ketat ketika hasil linear keluar dari interval. Keuntungan penyusutan tetap bergantung pada batas substantif \(M\); jika ruang parameter tidak dibatasi, bias dapat menjadi mahal dan klaim keunggulan universal tidak sah.
Masalah 4 — metode momen versus MLE pada titik ujung Seragam
Misalkan \(X_1,\ldots,X_n\) iid Seragam\((0,\theta)\).
- Turunkan penduga metode momen \(T_{\mathrm{MM}}\) dan MLE \(T_{\mathrm{MLE}}\).
- Hitung bias dan MSE keduanya untuk \(n=4\).
- Putuskan penduga mana yang memiliki MSE lebih kecil, dan jelaskan kompromi bias-variansnya.
Petunjuk 1
Rataan populasi Seragam\((0,\theta)\) adalah \(\theta/2\), sedangkan fungsi kemungkinan menurun terhadap \(\theta\) di atas maksimum sampel.
Petunjuk 2
Gunakan \(E[\bar X]=\theta/2\), \(\operatorname{Var}(\bar X)=\theta^2/(12n)\), dan untuk \(M=X_{(n)}\) gunakan \(E[M]=n\theta/(n+1)\) serta \(\operatorname{MSE}(M)=2\theta^2/[(n+1)(n+2)]\).
Jawaban singkat
\(T_{\mathrm{MM}}=2\bar X\) tak bias dengan MSE \(\theta^2/(3n)=\theta^2/12\) saat \(n=4\). Untuk \(M>0\), MLE adalah \(M\), dengan bias \(-\theta/5\) dan MSE \(\theta^2/15\). Jika \(M=0\), fungsi kemungkinan tidak mempunyai pemaksimum berhingga; kejadian ini berprobabilitas nol di bawah setiap \(\theta>0\). Jadi MLE memiliki MSE lebih kecil meskipun bias; ketakbiasan saja bukan kriteria penentu.
Solusi lengkap
Momen pertama teoretis adalah \(E_\theta[X]=\theta/2\). Menyamakan dengan \(\bar X\) menghasilkan penduga metode momen
Karena \(\operatorname{Var}(X)=\theta^2/12\),
Ia tak bias, jadi MSE sama dengan varians; untuk \(n=4\) nilainya \(\theta^2/12\).
Fungsi kemungkinan sampel adalah \(\theta^{-n}\mathbf1\{\theta\ge M\}\). Karena fungsi \(\theta^{-n}\) menurun, untuk \(M>0\) MLE adalah \(T_{\mathrm{MLE}}=M\). Jika \(M=0\), fungsi kemungkinan tidak berbatas ketika \(\theta\downarrow0\), sehingga tidak ada MLE berhingga; kejadian ini mempunyai probabilitas nol di bawah setiap \(\theta>0\). Karena itu perhitungan distribusional tidak berubah. Untuk \(n=4\), \(E[M]=4\theta/5\), sehingga bias \(-\theta/5\), dan rumus maksimum Seragam memberi
Karena \(1/15<1/12\), MLE memiliki MSE lebih kecil pada ukuran sampel ini. Variansnya memang lebih kecil sehingga mengimbangi kuadrat bias. Perbandingan ini berlaku untuk kerugian kuadrat dan model yang dinyatakan; ia bukan bukti bahwa MLE selalu terbaik di bawah kerugian lain atau pada model lain.
Masalah 5 — konsistensi tidak menjamin konvergensi harapan
Untuk sampel iid dengan rataan \(\mu\) dan varians \(\sigma^2<\infty\), definisikan \(A_n=(1+1/n)\bar X_n\). Lalu, secara independen dari sampel, definisikan \(R_n=n\) dengan peluang \(1/n\) dan \(0\) dengan peluang \(1-1/n\), serta \(B_n=\bar X_n+R_n\).
- Hitung bias dan MSE \(A_n\), lalu buktikan konsistensinya.
- Buktikan \(B_n\xrightarrow{P}\mu\) tetapi \(E[B_n]-\mu\not\to0\).
- Sebutkan kondisi tambahan yang akan menghubungkan konsistensi dengan konvergensi ekspektasi.
Petunjuk 1
Bias \(A_n\) adalah \(\mu/n\). Gunakan ketaksamaan Chebyshev untuk \(\bar X_n\) dan lihat bahwa MSE menuju nol.
Petunjuk 2
\(P(R_n>\varepsilon)=1/n\) untuk semua \(n>\varepsilon\), tetapi \(E[R_n]=1\). Gabungkan \(R_n\xrightarrow{P}0\) dengan LLN.
Jawaban singkat
\(A_n\) memiliki bias \(\mu/n\) dan \(\operatorname{MSE}(A_n)=(1+1/n)^2\sigma^2/n+\mu^2/n^2\to0\), sehingga konsisten. Untuk \(B_n\), \(R_n\xrightarrow{P}0\) tetapi \(E[R_n]=1\), jadi \(B_n\xrightarrow{P}\mu\) dan biasnya tetap satu. Untuk menyimpulkan konvergensi ekspektasi diperlukan syarat tambahan; misalnya, integrabilitas seragam dari \((B_n)_n\) sudah cukup. Dominasi oleh satu peubah acak integrabel atau batas seragam pada momen berorde lebih dari satu merupakan kondisi yang menyiratkan integrabilitas seragam.
Solusi lengkap
Karena \(E[\bar X_n]=\mu\),
Variansnya \((1+1/n)^2\sigma^2/n\), sehingga
MSE menuju nol menyiratkan konvergensi probabilitas, jadi \(A_n\) konsisten.
Untuk \(R_n\), bagi setiap \(\varepsilon>0\) dan \(n>\varepsilon\), \(P(|R_n|>\varepsilon)=1/n\to0\). LLN memberi \(\bar X_n\xrightarrow{P}\mu\), dan jumlah dua peubah yang masing-masing konvergen dalam probabilitas juga konvergen, sehingga \(B_n\xrightarrow{P}\mu\). Namun
untuk setiap \(n\). Peristiwa langka dengan nilai besar menggagalkan konvergensi harapan. Integrabilitas seragam, misalnya batas seragam untuk suatu momen berorde lebih dari satu, akan menghapus kontribusi ekor itu; konsistensi saja tidak memberikannya.
Masalah 6 — batas Cramér–Rao pada model Bernoulli
Misalkan \(X_1,\ldots,X_n\) iid Bernoulli\((p)\) dengan \(0<p<1\).
- Hitung skor dan informasi Fisher sampel.
- Tulis batas Cramér–Rao untuk penduga tak bias \(T\) bagi \(p\).
- Tunjukkan bahwa \(T=\bar X\) mencapai batas tersebut.
- Jelaskan mengapa argumen ini tidak langsung mencakup \(p=0\) atau \(p=1\).
Petunjuk 1
Fungsi log-kemungkinan adalah \(X_\cdot\log p+(n-X_\cdot)\log(1-p)\). Turunkan dua kali atau hitung varians skor.
Petunjuk 2
Informasi sampel adalah \(n/[p(1-p)]\). Turunan fungsi target \(g(p)=p\) adalah satu, sehingga batasnya adalah kebalikan informasi.
Jawaban singkat
Skor sampel \(S(p)=(X_\cdot-np)/[p(1-p)]\) dan informasi \(I_n(p)=n/[p(1-p)]\). Setiap penduga tak bias memenuhi \(\operatorname{Var}_p(T)\ge p(1-p)/n\). Karena \(\operatorname{Var}(\bar X)=p(1-p)/n\), rataan mencapai batas. Titik ujung tidak reguler karena \(p=0,1\) berada pada batas ruang parameter, distribusi menjadi degenerat, dan skor serta informasi interior tidak terdefinisi di sana.
Solusi lengkap
Dengan \(X_\cdot=\sum_iX_i\),
dan
Karena \(\operatorname{Var}(X_\cdot)=np(1-p)\),
Untuk target \(g(p)=p\), bentuk Cramér–Rao menyatakan bahwa penduga tak bias \(T\) dengan syarat keteraturan memenuhi
Rataan sampel tak bias dan variansnya tepat \(p(1-p)/n\), maka kesetaraan tercapai. Kesetaraan muncul karena skor linear terhadap \(X_\cdot\) dan rataan merupakan fungsi dari statistik cukup tersebut. Pada \(p=0\) atau \(1\), keluarga berada di titik ujung; turunan fungsi log-kemungkinan dan dukungan efektif tidak memenuhi asumsi interior yang dipakai dalam pembuktian, sehingga batas tersebut tidak boleh diekstrapolasi tanpa analisis titik ujung.
Masalah 7 — kecukupan dan perbaikan penduga Normal
Misalkan \(X_1,\ldots,X_n\) iid \(N(\mu,\sigma^2)\) dengan \(\sigma^2\) diketahui.
- Gunakan faktorisasi fungsi kemungkinan untuk menunjukkan bahwa \(\bar X\) cukup bagi \(\mu\).
- Untuk penduga tak bias awal \(T=X_1\), hitung \(E[T\mid\bar X]\) dan \(\operatorname{Var}(T\mid\bar X)\).
- Gunakan hukum varians total untuk membandingkan varians \(T\) dan \(E[T\mid\bar X]\).
Petunjuk 1
Fungsi kemungkinan bergantung pada data melalui \(\sum_iX_i=n\bar X\) dan \(\sum_iX_i^2\); suku kedua bebas dari \(\mu\) dan dapat diserap ke dalam faktor yang hanya bergantung pada data.
Petunjuk 2
Kovarians \(\operatorname{Cov}(X_1,\bar X)=\sigma^2/n\) dan \(\operatorname{Var}(\bar X)=\sigma^2/n\). Karena \((X_1,\bar X)\) berdistribusi Normal bersama, harapan bersyaratnya linear.
Jawaban singkat
Faktorisasi memberi kecukupan \(\bar X\). Karena pasangan \((X_1,\bar X)\) Normal, \(E[X_1\mid\bar X]=\bar X\) dan \(\operatorname{Var}(X_1\mid\bar X)=\sigma^2(1-1/n)\). Jadi penduga terkondisi adalah \(\bar X\), tetap tak bias, dan variansnya \(\sigma^2/n\), lebih kecil dari \(\operatorname{Var}(X_1)=\sigma^2\) untuk \(n>1\).
Solusi lengkap
Fungsi kemungkinan bersama, mengabaikan konstanta yang tidak bergantung pada \(\mu\), adalah
Faktor pertama bergantung pada data melalui \(\bar x\), sedangkan faktor kedua tidak bergantung pada \(\mu\). Teorema faktorisasi menunjukkan bahwa \(\bar X\) adalah statistik cukup.
Selanjutnya \((X_1,\bar X)\) berdistribusi Normal bivariat dengan \(E[X_1]=E[\bar X]=\mu\), \(\operatorname{Var}(X_1)=\sigma^2\), \(\operatorname{Var}(\bar X)=\sigma^2/n\), dan kovarians \(\sigma^2/n\). Rumus harapan bersyarat Normal memberi
sedangkan varians bersyarat adalah \(\sigma^2-(\sigma^2/n)^2/(\sigma^2/n)=\sigma^2(1-1/n)\). Hukum varians total menyatakan
Dengan demikian, \(\sigma^2=\sigma^2/n+\sigma^2(1-1/n)\). Pengondisian mempertahankan ketakbiasan tetapi menghapus variasi yang tidak informatif tentang \(\mu\); keunggulan khusus ini memerlukan kerugian dan syarat yang dinyatakan.
Masalah 8 — penduga Laplace untuk proporsi dekat batas
Misalkan \(X\sim\operatorname{Binomial}(n,p)\) dan bandingkan \(T_0=X/n\) dengan penduga Laplace \(T_L=(X+1)/(n+2)\).
- Turunkan bias, varians, dan MSE \(T_L\) sebagai fungsi \(n,p\).
- Untuk \(n=10\), hitung MSE kedua penduga pada \(p=0{,}1\) dan \(p=0{,}5\).
- Jelaskan mengapa penduga yang lebih stabil di dekat batas tidak otomatis mendominasi pada semua nilai \(p\).
Petunjuk 1
Gunakan \(E[X]=np\) dan \(\operatorname{Var}(X)=np(1-p)\). Penduga \(T_L\) menyusut menuju \(1/2\) karena dua observasi semu ditambahkan.
Petunjuk 2
Untuk \(T_0\), MSE sama dengan \(p(1-p)/n\). Untuk \(T_L\), gabungkan kuadrat bias \((1-2p)^2/(n+2)^2\) dengan varians \(np(1-p)/(n+2)^2\).
Jawaban singkat
Pada \(n=10\), MSE \(T_0\) adalah \(0{,}009\) untuk \(p=0{,}1\) dan \(0{,}025\) untuk \(p=0{,}5\); MSE \(T_L\) berturut-turut \(77/7200\approx0{,}010694\) dan \(5/288\approx0{,}017361\). Jadi penghalusan membantu di tengah tetapi sedikit merugikan pada contoh dekat batas ini.
Solusi lengkap
Untuk penduga rataan, \(E[T_0]=p\) dan \(\operatorname{MSE}(T_0)=\operatorname{Var}(T_0)=p(1-p)/n\). Untuk \(T_L\),
sehingga
Pembagian oleh konstanta memberi
dan karenanya
Dengan \(n=10,p=0{,}1\), rataan mempunyai MSE \(0{,}1(0{,}9)/10=0{,}009\). Untuk Laplace, pembilangnya \(10(0{,}1)(0{,}9)+(0{,}8)^2=0{,}9+0{,}64=1{,}54\), sehingga MSE \(1{,}54/144=77/7200\approx0{,}010694\). Pada \(p=0{,}5\), bias Laplace nol; MSE-nya \(10(0{,}25)/144=5/288\approx0{,}017361\), sedangkan rataan mempunyai MSE \(0{,}25/10=0{,}025\). Observasi semu mengurangi varians dan mencegah nilai ekstrem, tetapi dapat menimbulkan bias besar ketika \(p\) jauh dari \(1/2\). Pilihan harus mengikuti ruang parameter, kerugian, dan tujuan kalibrasi, bukan slogan bahwa penghalusan selalu lebih baik.
Daftar periksa kelulusan
Set ini dikuasai bila Anda dapat menuliskan distribusi pengambilan sampel sebelum menilai penduga, memisahkan bias dari varians, dan menyatakan ruang parameter serta kerugian ketika memakai risiko. Konsistensi, kecukupan, ketakbiasan, dan efisiensi adalah sifat berbeda; satu tidak boleh disimpulkan hanya dari yang lain.