Ingat kembali model dasar statistika: kita memiliki populasi objek yang menjadi perhatian dan berbagai pengukuran (variabel) yang dilakukan terhadap objek-objek tersebut. Kita memilih objek dari populasi dan mencatat variabel untuk objek-objek dalam sampel; catatan ini menjadi data kita. Sekali lagi, pembahasan pertama kita menggunakan sudut pandang deskriptif. Artinya, kita tidak mengasumsikan bahwa data dihasilkan oleh suatu distribusi probabilitas yang mendasarinya. Namun, ingat bahwa data itu sendiri membentuk suatu distribusi probabilitas.
Misalkan \(\bs{x} = (x_1, x_2, \ldots, x_n)\) merupakan sampel berukuran \(n\), dengan sedikitnya dua pengamatan, dari variabel bernilai riil \(x\). Ingat bahwa rata-rata sampel adalah \[ m = \frac{1}{n} \sum_{i=1}^n x_i \] dan merupakan ukuran pemusatan terpenting bagi himpunan data.
Varians sampel didefinisikan sebagai \[ s^2 = \frac{1}{n - 1} \sum_{i=1}^n (x_i - m)^2 \] Akar kuadrat \(s\) dari varians sampel \(s^2\) adalah simpangan baku sampel.
Jika kita perlu menunjukkan kebergantungannya pada vektor data \(\bs{x}\), kita menulis \(s^2(\bs{x})\). Selisih \(x_i - m\) adalah deviasi \(x_i\) dari rata-rata \(m\) himpunan data. Jadi, varians merupakan deviasi kuadrat rata-rata dan menjadi ukuran penyebaran himpunan data terhadap rata-ratanya. Alasan pembagian dengan \(n - 1\), bukan \(n\), paling baik dipahami melalui sudut pandang inferensial yang dibahas di bawah; definisi ini menjadikan varians sampel sebagai penduga tak bias bagi varians distribusi. Namun, alasan perata-rataan tersebut juga dapat dipahami melalui konsep yang terkait.
\(\sum_{i=1}^n (x_i - m) = 0\).
\(\sum_{i=1}^n (x_i - m) = \sum_{i=1}^n x_i - \sum_{i=1}^n m = n m - n m = 0\).
Jadi, jika kita mengetahui \(n - 1\) deviasi, kita dapat menghitung deviasi terakhir. Ini berarti hanya ada \(n - 1\) deviasi yang dapat berubah secara bebas, yakni \(n - 1\) derajat kebebasan dalam himpunan deviasi tersebut. Dalam definisi varians sampel, kita merata-ratakan kuadrat deviasi bukan dengan membaginya menurut banyaknya suku, melainkan menurut banyaknya derajat kebebasan dalam suku-suku itu. Meskipun demikian, dari sudut pandang yang murni deskriptif, pembagian dengan \(n\) dalam definisi varians sampel juga masuk akal. Selain itu, ketika \(n\) cukup besar, hampir tidak ada perbedaan antara pembagian dengan \(n\) dan pembagian dengan \(n - 1\).
Simpangan baku \(s\) adalah akar dari rata-rata kuadrat deviasi dan juga menjadi ukuran penyebaran data terhadap rata-ratanya. Kedua ukuran penyebaran ini penting. Varians memiliki sifat matematis yang lebih baik, tetapi satuan fisiknya adalah kuadrat satuan \(x\). Sebagai contoh, jika variabel yang mendasarinya, \(x\), adalah tinggi seseorang dalam inci, varians dinyatakan dalam inci kuadrat. Di sisi lain, simpangan baku memiliki satuan fisik yang sama dengan variabel asal, tetapi sifat matematisnya tidak sebaik varians.
Ingat bahwa himpunan data \(\bs{x}\) secara alami menghasilkan suatu distribusi probabilitas, yaitu distribusi empiris yang menempatkan probabilitas \(\frac{1}{n}\) pada \(x_i\) untuk setiap \(i\). Jadi, jika datanya berbeda-beda, distribusi ini merupakan distribusi seragam pada \(\{x_1, x_2, \ldots, x_n\}\). Rata-rata sampel \(m\) hanyalah nilai harapan dari distribusi empiris. Demikian pula, jika kita membagi dengan \(n\), bukan \(n - 1\), varians sampel akan menjadi varians distribusi empiris. Sebagian besar sifat dan hasil dalam bagian ini mengikuti sifat dan hasil yang jauh lebih umum untuk varians suatu distribusi probabilitas (meskipun sebagian besar pembuktian diberikan secara mandiri).
Ukuran pemusatan dan ukuran penyebaran paling baik dipahami secara bersamaan dalam konteks suatu fungsi galat. Fungsi galat mengukur seberapa baik sebuah bilangan \(a\) mewakili seluruh himpunan data \(\bs{x}\). Nilai-nilai \(a\) (jika ada) yang meminimumkan fungsi galat menjadi ukuran pemusatan kita; nilai minimum fungsi galat menjadi ukuran penyebaran yang bersesuaian. Tentu saja, kita mengharapkan satu nilai \(a\) saja yang meminimumkan fungsi galat agar ukuran pemusatannya unik.
Mari terapkan prosedur ini pada fungsi galat kuadrat rata-rata yang didefinisikan oleh \[ \mse(a) = \frac{1}{n - 1} \sum_{i=1}^n (x_i - a)^2, \quad a \in \R \] Meminimumkan \(\mse\) merupakan persoalan baku dalam kalkulus.
Grafik \(\mse\) merupakan parabola yang terbuka ke atas.
Dari bentuk \(\mse\), kita dapat melihat bahwa grafiknya merupakan parabola yang terbuka ke atas. Mengambil turunannya memberikan \[ \frac{d}{da} \mse(a) = -\frac{2}{n - 1}\sum_{i=1}^n (x_i - a) = -\frac{2}{n - 1}(n m - n a) \] Karena itu, \(a = m\) merupakan satu-satunya nilai yang meminimumkan \(\mse\). Tentu saja, \(\mse(m) = s^2\).
Jelas bahwa jika fungsi galat kuadrat rata-rata didefinisikan dengan membagi oleh \(n\), bukan \(n - 1\), minimum tetap terjadi pada \(m\), yaitu rata-rata sampel, tetapi nilai minimumnya menjadi versi alternatif varians sampel yang menggunakan pembagi \(n\). Di sisi lain, jika kita menggunakan fungsi akar dari galat kuadrat rata-rata \(\text{rmse}(a) = \sqrt{\mse(a)}\), maka karena fungsi akar kuadrat meningkat ketat pada \([0, \infty)\), minimum kembali terjadi pada \(m\), yaitu rata-rata sampel, tetapi nilai minimumnya adalah \(s\), yaitu simpangan baku sampel. Pokok pentingnya ialah bahwa untuk semua fungsi galat ini, ukuran pemusatan yang unik adalah rata-rata sampel, sedangkan ukuran penyebaran yang bersesuaian adalah berbagai ukuran yang sedang kita pelajari.
Selanjutnya, mari terapkan prosedur kita pada fungsi galat absolut rata-rata yang didefinisikan oleh \[ \mae(a) = \frac{1}{n - 1} \sum_{i=1}^n \left|x_i - a\right|, \quad a \in \R \]
Fungsi galat absolut rata-rata memiliki sifat-sifat berikut:
Untuk bagian (a) dan (b), perhatikan bahwa untuk setiap \(i\), \(\left|x_i - a\right|\) merupakan fungsi kontinu dari \(a\), dengan grafik yang terdiri atas dua garis (berkemiringan \(\pm 1\)) yang bertemu di \(x_i\).
Secara matematis, \(\mae\) memiliki beberapa masalah sebagai fungsi galat. Pertama, fungsi ini tidak mulus (tidak terdiferensialkan) di titik pertemuan dua garis yang kemiringannya berbeda. Yang lebih penting, nilai-nilai yang meminimumkannya dapat menempati suatu interval penuh sehingga kita tidak memperoleh ukuran pemusatan yang unik. Latihan dan menunjukkan bahwa patologi tersebut benar-benar dapat terjadi. Ternyata, \(\mae\) mencapai minimum di setiap titik dalam interval median himpunan data \(\bs{x}\). Pembuktian hasil ini mengikuti suatu hasil yang jauh lebih umum untuk distribusi probabilitas. Jadi, median merupakan ukuran pemusatan alami yang terkait dengan \(\mae\) sebagai ukuran galat, sebagaimana rata-rata sampel merupakan ukuran pemusatan yang terkait dengan \(\mse\) sebagai ukuran galat.
Dalam bagian ini, kita menetapkan beberapa sifat penting varians dan simpangan baku sampel. Pertama, rumus alternatif berikut untuk varians sampel lebih baik bagi keperluan komputasi dan juga bagi keperluan teoretis tertentu.
Varians sampel dapat dihitung sebagai \[ s^2 = \frac{1}{n - 1} \sum_{i=1}^n x_i^2 - \frac{n}{n - 1} m^2 \]
Perhatikan bahwa \begin{align} \sum_{i=1}^n (x_i - m)^2 & = \sum_{i=1}^n \left(x_i^2 - 2 m x_i + m^2\right) = \sum_{i=1}^n x_i^2 - 2 m \sum_{i=1}^n x_i + \sum_{i=1}^n m^2\\ & = \sum_{i=1}^n x_i^2 - 2 n m^2 + n m^2 = \sum_{i=1}^n x_i^2 - n m^2 \end{align} Pembagian dengan \(n - 1\) memberikan hasil tersebut.
Jika \(\bs{x}^2 = (x_1^2, x_2^2, \ldots, x_n^2)\) menyatakan sampel dari variabel \(x^2\), rumus komputasi dalam dapat ditulis secara ringkas sebagai \[ s^2(\bs{x}) = \frac{n}{n - 1} \left[m(\bs{x}^2) - m^2(\bs{x})\right] \] Teorema berikut memberikan rumus komputasi lain untuk varians sampel, langsung dalam variabel-variabelnya sehingga tidak memerlukan perhitungan statistik perantara.
Varians sampel dapat dihitung sebagai \[ s^2 = \frac{1}{2 n (n - 1)} \sum_{i=1}^n \sum_{j=1}^n (x_i - x_j)^2 \]
Perhatikan bahwa \begin{align} \frac{1}{2 n} \sum_{i=1}^n \sum_{j=1}^n (x_i - x_j)^2 & = \frac{1}{2 n} \sum_{i=1}^n \sum_{j=1}^n (x_i - m + m - x_j)^2 \\ & = \frac{1}{2 n} \sum_{i=1}^n \sum_{j=1}^n \left[(x_i - m)^2 + 2 (x_i - m)(m - x_j) + (m - x_j)^2\right] \\ & = \frac{1}{2 n} \sum_{i=1}^n \sum_{j=1}^n (x_i - m)^2 + \frac{1}{n} \sum_{i=1}^n \sum_{j=1}^n (x_i - m)(m - x_j) + \frac{1}{2 n} \sum_{i=1}^n \sum_{j=1}^n (m - x_j)^2 \\ & = \frac{1}{2} \sum_{i=1}^n (x_i - m)^2 + 0 + \frac{1}{2} \sum_{j=1}^n (m - x_j)^2 \\ & = \sum_{i=1}^n (x_i - m)^2 \end{align} Pembagian dengan \(n - 1\) memberikan hasil tersebut.
Varians sampel bersifat taknegatif:
Bagian (a) sudah jelas. Untuk bagian (b), perhatikan bahwa jika \(s^2 = 0\), maka \(x_i = m\) untuk setiap \(i\). Sebaliknya, jika \(\bs{x}\) merupakan vektor konstan, maka \(m\) adalah konstanta yang sama.
Jadi, \(s^2 = 0\) jika dan hanya jika himpunan data konstan (dan tentu saja, rata-ratanya adalah nilai bersama tersebut).
Jika \(c\) merupakan konstanta, maka
Untuk bagian (a), ingat bahwa \(m(c \bs{x}) = c m(\bs{x})\). Karena itu, \[ s^2(c \bs{x}) = \frac{1}{n - 1}\sum_{i=1}^n \left[c x_i - c m(\bs{x})\right]^2 = \frac{1}{n - 1} \sum_{i=1}^n c^2 \left[x_i - m(\bs{x})\right]^2 = c^2 s^2(\bs{x}) \]
Jika \(\bs{c}\) merupakan sampel berukuran \(n\) dari suatu konstanta \(c\), maka
Ingat bahwa \(m(\bs{x} + \bs{c}) = m(\bs{x}) + c\). Karena itu, \[ s^2(\bs{x} + \bs{c}) = \frac{1}{n - 1} \sum_{i=1}^n \left\{(x_i + c) - \left[m(\bs{x}) + c\right]\right\}^2 = \frac{1}{n - 1} \sum_{i=1}^n \left[x_i - m(\bs{x})\right]^2 = s^2(\bs{x})\]
Sebagai kasus khusus dari hasil-hasil ini, misalkan \(\bs{x} = (x_1, x_2, \ldots, x_n)\) merupakan sampel berukuran \(n\) yang bersesuaian dengan variabel riil \(x\), dan misalkan \(a\) dan \(b\) merupakan konstanta. Dalam notasi vektor kita, sampel yang bersesuaian dengan variabel \(y = a + b x\) adalah \(\bs{a} + b \bs{x}\). Maka \(m(\bs{a} + b \bs{x}) = a + b m(\bs{x})\) dan \(s(\bs{a} + b \bs{x}) = \left|b\right| s(\bs{x})\). Transformasi linear jenis ini, ketika \(b \gt 0\), sering muncul saat satuan fisik diubah. Dalam hal ini, transformasi tersebut sering disebut transformasi lokasi-skala; \(a\) adalah parameter lokasi dan \(b\) adalah parameter skala. Sebagai contoh, jika \(x\) merupakan panjang suatu objek dalam inci, maka \(y = 2.54 x\) merupakan panjang objek tersebut dalam sentimeter. Jika \(x\) merupakan suhu suatu objek dalam derajat Fahrenheit, maka \(y = \frac{5}{9}(x - 32)\) merupakan suhu objek tersebut dalam derajat Celsius.
Sekarang, anggap himpunan data tidak konstan sehingga simpangan bakunya positif. Untuk \(i \in \{1, 2, \ldots, n\}\), misalkan \( z_i = (x_i - m) / s\). Bilangan \(z_i\) adalah skor baku yang berkaitan dengan \(x_i\). Karena \(x_i\), \(m\), dan \(s\) mempunyai satuan fisik yang sama, skor baku \(z_i\) bersifat tak berdimensi (yakni tidak memiliki satuan fisik); skor ini mengukur jarak berarah dari rata-rata \(m\) ke nilai data \(x_i\) dalam satuan simpangan baku.
Sampel skor baku \(\bs{z} = (z_1, z_2, \ldots, z_n)\) memiliki rata-rata 0 dan varians 1. Artinya,
Hasil-hasil ini mengikuti sifat penskalaan dan translasi di atas. Dalam notasi vektor, perhatikan bahwa \(\bs{z} = (\bs{x} - \bs{m})/s\). Karena itu, \(m(\bs{z}) = (m - m) / s = 0\) dan \(s(\bs{z}) = s / s = 1\).
Misalkan, sebagai pengganti data sebenarnya \(\bs{x}\), kita mempunyai distribusi frekuensi yang bersesuaian dengan suatu partisi berkategori (interval) \((A_1, A_2, \ldots, A_k)\), tanda kelas (titik tengah interval) \((t_1, t_2, \ldots, t_k)\), dan frekuensi \((n_1, n_2, \ldots, n_k)\). Ingat bahwa frekuensi relatif kelas \(A_j\) adalah \(p_j = n_j / n\). Dalam hal ini, nilai aproksimasi rata-rata dan varians sampel berturut-turut adalah \begin{align} m & = \frac{1}{n} \sum_{j=1}^k n_j \, t_j = \sum_{j = 1}^k p_j \, t_j \\ s^2 & = \frac{1}{n - 1} \sum_{j=1}^k n_j (t_j - m)^2 = \frac{n}{n - 1} \sum_{j=1}^k p_j (t_j - m)^2 \end{align} Aproksimasi ini didasarkan pada harapan bahwa nilai data dalam setiap kelas terwakili dengan baik oleh tanda kelasnya. Sesungguhnya, inilah definisi baku rata-rata dan varians sampel bagi himpunan data yang memuat \(t_j\) sebanyak \(n_j\) kali untuk setiap \(j\).
Kita melanjutkan pembahasan varians sampel, tetapi kini kita mengasumsikan bahwa variabel-variabelnya acak. Misalkan kita mempunyai suatu percobaan acak dasar dan \(X\) merupakan variabel acak bernilai riil bagi percobaan tersebut, dengan rata-rata \(\mu\) dan simpangan baku \(\sigma\). Kita juga memerlukan beberapa momen berorde lebih tinggi. Misalkan \(\sigma_3 = \E\left[(X - \mu)^3\right]\) dan \(\sigma_4 = \E\left[(X - \mu)^4\right]\) menyatakan momen ke-3 dan ke-4 terhadap rata-rata. Ingat bahwa \(\sigma_3 \big/ \sigma^3 = \skw(X)\), yaitu kemencengan \(X\), dan \(\sigma_4 \big/ \sigma^4 = \kur(X)\), yaitu kurtosis \(X\). Kita mengasumsikan \(\sigma_4 \lt \infty\).
Kita mengulangi percobaan dasar sebanyak \(n\) kali untuk membentuk percobaan gabungan baru, dengan barisan variabel acak independen \(\bs{X} = (X_1, X_2, \ldots, X_n)\), yang masing-masing berdistribusi sama dengan \(X\). Dalam istilah statistika, \(\bs{X}\) merupakan sampel acak berukuran \(n\) dari distribusi \(X\). Semua statistik di atas tentu bermakna bagi \(\bs{X}\), tetapi sekarang statistik-statistik tersebut merupakan variabel acak. Kita akan menggunakan notasi yang sama, kecuali konvensi umum untuk menyatakan variabel acak dengan huruf kapital. Terakhir, perhatikan bahwa sifat dan hubungan deterministik yang ditetapkan di atas tetap berlaku.
Selain menjadi ukuran pemusatan data \(\bs{X}\), rata-rata sampel \[ M = \frac{1}{n} \sum_{i=1}^n X_i \] merupakan penduga alami bagi rata-rata distribusi \(\mu\). Dalam bagian ini, kita akan menurunkan statistik yang menjadi penduga alami bagi varians distribusi \(\sigma^2\). Statistik yang kita turunkan berbeda, bergantung pada diketahui atau tidaknya \(\mu\); karena alasan ini, \(\mu\) disebut parameter pengganggu dalam persoalan pendugaan \(\sigma^2\).
Pertama, kita akan mengasumsikan bahwa \(\mu\) diketahui. Meskipun hampir selalu merupakan asumsi buatan, ini merupakan titik awal yang baik karena analisisnya relatif mudah dan memberi kita wawasan bagi kasus baku. Penduga alami untuk \(\sigma^2\) adalah statistik berikut, yang akan kita sebut varians sampel khusus. \[ W^2 = \frac{1}{n} \sum_{i=1}^n (X_i - \mu)^2 \]
\(W^2\) merupakan rata-rata sampel bagi sampel acak berukuran \(n\) dari distribusi \((X - \mu)^2\), dan memiliki sifat-sifat berikut:
Hasil-hasil ini langsung mengikuti hasil baku dalam bagian tentang Hukum Bilangan Besar dan bagian tentang Teorema Limit Pusat. Untuk bagian (b), perhatikan bahwa \[\var\left[(X - \mu)^2\right] = \E\left[(X - \mu)^4\right] -\left(\E\left[(X - \mu)^2\right]\right)^2 = \sigma_4 - \sigma^4\]
Secara khusus, bagian (a) berarti bahwa \(W^2\) merupakan penduga tak bias bagi \(\sigma^2\). Dari bagian (b), perhatikan bahwa \(\var(W^2) \to 0\) ketika \(n \to \infty\); ini berarti \(W^2\) merupakan penduga konsisten bagi \(\sigma^2\). Akar kuadrat varians sampel khusus adalah versi khusus dari simpangan baku sampel, yang dilambangkan dengan \(W\).
\(\E(W) \le \sigma\). Jadi, \(W\) merupakan penduga berbias negatif yang cenderung menaksir \(\sigma\) terlalu rendah.
Hasil ini mengikuti sifat tak bias dan ketaksamaan Jensen. Karena \(w \mapsto \sqrt{w}\) cekung ke bawah pada \([0, \infty)\), kita mempunyai \(\E(W) = \E\left(\sqrt{W^2}\right) \le \sqrt{\E\left(W^2\right)} = \sqrt{\sigma^2} = \sigma\).
Selanjutnya, kita menghitung kovarians dan korelasi antara rata-rata sampel dan varians sampel khusus. Rumus korelasi berikut berlaku ketika simpangan baku distribusi dasar positif dan kuadrat deviasinya tidak hampir pasti konstan.
Kovarians dan korelasi antara \(M\) dan \(W^2\) adalah
Perhatikan bahwa korelasi tidak bergantung pada ukuran sampel, dan bahwa rata-rata sampel serta varians sampel khusus tidak berkorelasi jika \(\sigma_3 = 0\) (secara ekuivalen, \(\skw(X) = 0\)).
Sekarang, tinjau kasus yang lebih realistis ketika \(\mu\) tidak diketahui dan sampel memuat sedikitnya dua pengamatan. Dalam hal ini, pendekatan alami ialah merata-ratakan, dalam arti tertentu, kuadrat deviasi \((X_i - M)^2\) atas \(i \in \{1, 2, \ldots, n\}\). Tampaknya kita seharusnya merata-ratakannya dengan membagi oleh \(n\). Namun, pendekatan lain ialah membagi dengan konstanta yang menghasilkan penduga tak bias bagi \(\sigma^2\). Ternyata konstanta ini adalah \(n - 1\), yang menghasilkan varians sampel baku: \[ S^2 = \frac{1}{n - 1} \sum_{i=1}^n (X_i - M)^2 \]
\(\E\left(S^2\right) = \sigma^2\).
Dengan menguraikannya (seperti ditunjukkan dalam bagian sebelumnya), \[ \sum_{i=1}^n (X_i - M)^2 = \sum_{i=1}^n X_i^2 - n M^2 \] Ingat bahwa \(\E(M) = \mu\) dan \(\var(M) = \sigma^2 / n\). Mengambil nilai harapan pada persamaan yang ditampilkan memberikan \[ \E\left(\sum_{i=1}^n (X_i - M)^2\right) = \sum_{i=1}^n (\sigma^2 + \mu^2) - n \left(\frac{\sigma^2}{n} + \mu^2\right) = n (\sigma^2 + \mu^2) -n \left(\frac{\sigma^2}{n} + \mu^2\right) = (n - 1) \sigma^2 \]
Tentu saja, akar kuadrat varians sampel adalah simpangan baku sampel, yang dilambangkan dengan \(S\).
\(\E(S) \le \sigma\). Jadi, \(S\) merupakan penduga berbias negatif yang cenderung menaksir \(\sigma\) terlalu rendah.
\(S^2 \to \sigma^2\) ketika \(n \to \infty\) dengan probabilitas 1.
Hasil ini mengikuti hukum bilangan besar kuat. Ingat kembali bahwa \[ S^2 = \frac{1}{n - 1} \sum_{i=1}^n X_i^2 - \frac{n}{n - 1} M^2 = \frac{n}{n - 1}[M(\bs{X}^2) - M^2(\bs{X})] \] Namun, dengan probabilitas 1, \(M(\bs{X}^2) \to \sigma^2 + \mu^2\) ketika \(n \to \infty\) dan \(M^2(\bs{X}) \to \mu^2\) ketika \(n \to \infty\).
Karena \(S^2\) merupakan penduga tak bias bagi \(\sigma^2\), varians \(S^2\) adalah galat kuadrat rata-rata, yaitu ukuran kualitas penduga.
\(\var\left(S^2\right) = \frac{1}{n} \left( \sigma_4 - \frac{n - 3}{n - 1} \sigma^4 \right)\).
Ingat dari bahwa \[ S^2 = \frac{1}{2 n (n - 1)} \sum_{i=1}^n \sum_{j=1}^n (X_i - X_j)^2 \] Karena itu, dengan menggunakan sifat bilinear kovarians, kita memperoleh \[ \var(S^2) = \cov(S^2, S^2) = \frac{1}{4 n^2 (n - 1)^2} \sum_{i=1}^n \sum_{j=1}^n \sum_{k=1}^n \sum_{l=1}^n \cov[(X_i - X_j)^2, (X_k - X_l)^2] \] Kita menghitung kovarians dalam jumlah ini dengan meninjau kasus-kasus saling lepas:
Substitusi memberikan hasil tersebut.
Perhatikan bahwa \(\var(S^2) \to 0\) ketika \(n \to \infty\), sehingga \(S^2\) merupakan penduga konsisten bagi \(\sigma^2\). Varians dari varians sampel baku (ketika \(\mu\) tidak diketahui) tidak lebih kecil daripada varians dari varians sampel khusus (ketika \(\mu\) diketahui), dan lebih besar ketika varians distribusi dasar positif.
\(\var\left(S^2\right) \ge \var\left(W^2\right)\).
Selanjutnya, kita menghitung kovarians antara rata-rata sampel dan varians sampel.
Kovarians dan korelasi antara rata-rata sampel dan varians sampel adalah sebagai berikut; rumus korelasi berlaku ketika kedua varians pada penyebutnya positif.
Secara khusus, perhatikan bahwa \(\cov(M, S^2) = \cov(M, W^2)\). Sekali lagi, rata-rata dan varians sampel tidak berkorelasi jika \(\sigma_3 = 0\), sehingga \(\skw(X) = 0\). Hasil terakhir kita memberikan kovarians dan korelasi antara varians sampel khusus dan varians sampel baku. Menariknya, kovarians tersebut sama dengan varians dari varians sampel khusus.
Kovarians dan korelasi antara \(W^2\) dan \(S^2\) adalah sebagai berikut; rumus korelasi berlaku ketika kedua varians pada penyebutnya positif.
Dari rumus korelasi di atas, jika varians yang diperlukan positif, diperoleh \(\cor\left(W^2, S^2\right) \to 1\) ketika \(n \to \infty\). Konvergensi \(S^2 \to \sigma^2\) dan \(W^2 \to \sigma^2\) ketika \(n \to \infty\) saja tidak cukup untuk menyimpulkan konvergensi korelasi tersebut.
Kasus khusus yang sangat penting terjadi ketika distribusi asal sampel bersifat normal. Kasus ini dikaji dalam bagian tentang Sifat Khusus Sampel Normal.
Misalkan \(x\) adalah suhu (dalam derajat Fahrenheit) suatu jenis komponen elektronik setelah 10 jam beroperasi. Sampel yang terdiri atas 30 komponen memiliki rata-rata 113° dan simpangan baku \(18°\).
Misalkan \(x\) adalah panjang (dalam inci) suatu komponen hasil pemesinan dalam proses manufaktur. Sampel yang terdiri atas 50 komponen memiliki rata-rata 10.0 dan simpangan baku 2.0.
Profesor Moriarity mengajar satu seksi Statistika 101 yang terdiri atas 25 mahasiswa di Enormous State University (ESU). Nilai rata-rata ujian tengah semester pertama adalah 64 (dari maksimum 100 poin) dan simpangan bakunya 16. Ia menganggap nilai-nilai tersebut agak rendah dan mempertimbangkan berbagai transformasi untuk menaikkannya. Dalam setiap kasus di bawah, berikan rata-rata dan simpangan baku nilai yang telah ditransformasi, atau nyatakan bahwa informasinya tidak cukup.
Salah satu mahasiswa sama sekali tidak belajar dan memperoleh nilai 10 pada ujian tengah semester. Profesor Moriarity menganggap nilai ini sebagai pencilan.
Semua paket perangkat lunak statistika dapat menghitung rata-rata, varians, dan simpangan baku, menggambar diagram titik dan histogram, serta secara umum menjalankan prosedur numerik dan grafis yang dibahas dalam bagian ini. Untuk percobaan statistika nyata, terutama yang menggunakan himpunan data besar, penggunaan perangkat lunak statistika sangat penting. Di sisi lain, menghitung secara manual dengan himpunan data buatan yang kecil tetap bermanfaat untuk menguasai konsep dan definisi. Dalam subbagian ini, lakukan perhitungan dan gambarlah grafik dengan bantuan teknologi seminimal mungkin.
Misalkan \(x\) adalah banyaknya mata kuliah matematika yang telah diselesaikan seorang mahasiswa ESU. Sampel yang terdiri atas 10 mahasiswa ESU memberikan data \(\bs{x} = (3, 1, 2, 0, 2, 4, 3, 2, 1, 2)\).
| \(i\) | \(x_i\) | \(x_i - m\) | \((x_i - m)^2\) |
|---|---|---|---|
| \(1\) | \(3\) | \(1\) | \(1\) |
| \(2\) | \(1\) | \(-1\) | \(1\) |
| \(3\) | \(2\) | \(0\) | \(0\) |
| \(4\) | \(0\) | \(-2\) | \(4\) |
| \(5\) | \(2\) | \(0\) | \(0\) |
| \(6\) | \(4\) | \(2\) | \(4\) |
| \(7\) | \(3\) | \(1\) | \(1\) |
| \(8\) | \(2\) | \(0\) | \(0\) |
| \(9\) | \(1\) | \(-1\) | \(1\) |
| \(10\) | \(2\) | \(0\) | \(0\) |
| Jumlah | 20 | 0 | 14 |
| Rata-rata; kolom terakhir: varians sampel | 2 | 0 | \(14/9\) |
Misalkan sampel berukuran 12 dari variabel diskret \(x\) mempunyai fungsi kepadatan empiris yang diberikan oleh \(f(-2) = 1/12\), \(f(-1) = 1/4\), \(f(0) = 1/3\), \(f(1) = 1/6\), \(f(2) = 1/6\).
Tabel berikut memberikan distribusi frekuensi jarak tempuh ke gedung matematika/statistika (dalam mil) bagi suatu sampel mahasiswa ESU.
| Kelas | Frek | Frek Rel | Kepadatan | Frek Kum | Frek Rel Kum | Titik Tengah |
|---|---|---|---|---|---|---|
| \((0, 2]\) | 6 | |||||
| \((2, 6]\) | 16 | |||||
| \((6, 10]\) | 18 | |||||
| \((10, 20]\) | 10 | |||||
| Jumlah |
| Kelas | Frek | Frek Rel | Kepadatan | Frek Kum | Frek Rel Kum | Titik Tengah |
|---|---|---|---|---|---|---|
| \((0, 2]\) | 6 | 0.12 | 0.06 | 6 | 0.12 | 1 |
| \((2, 6]\) | 16 | 0.32 | 0.08 | 22 | 0.44 | 4 |
| \((6, 10]\) | 18 | 0.36 | 0.09 | 40 | 0.80 | 8 |
| \((10, 20]\) | 10 | 0.20 | 0.02 | 50 | 1 | 15 |
| Jumlah | 50 | 1 |
Dalam aplikasi fungsi galat, pilih akar galat kuadrat rata-rata. Saat Anda menambahkan titik, perhatikan bentuk grafik fungsi galat, nilai yang meminimumkan fungsi tersebut, dan nilai minimum fungsinya.
Dalam aplikasi fungsi galat, pilih galat absolut rata-rata. Saat Anda menambahkan titik, perhatikan bentuk grafik fungsi galat, nilai-nilai yang meminimumkan fungsi tersebut, dan nilai minimum fungsinya.
Misalkan vektor data kita adalah \((2, 1, 5, 7)\). Nyatakan \(\mae\) secara eksplisit sebagai fungsi sepotong-sepotong dan sketsakan grafiknya. Perhatikan bahwa
Misalkan vektor data kita adalah \((3, 5, 1)\). Nyatakan \(\mae\) secara eksplisit sebagai fungsi sepotong-sepotong dan sketsakan grafiknya. Perhatikan bahwa
Banyak aplikasi dalam proyek ini menyimulasikan percobaan dengan suatu variabel acak dasar yang menjadi perhatian. Ketika menjalankan simulasi, Anda melakukan replikasi percobaan secara independen. Dalam kebanyakan kasus, aplikasi menampilkan simpangan baku distribusi, baik secara numerik dalam tabel maupun secara grafis sebagai jari-jari bilah horizontal biru di kotak grafik. Ketika simulasi dijalankan, simpangan baku sampel juga ditampilkan secara numerik dalam tabel dan secara grafis sebagai jari-jari bilah horizontal merah di kotak grafik.
Dalam percobaan koin binomial, variabel acaknya adalah banyaknya sisi gambar. Untuk berbagai nilai parameter \(n\) (banyaknya koin) dan \(p\) (probabilitas sisi gambar), jalankan simulasi 1.000 kali dan bandingkan simpangan baku sampel dengan simpangan baku distribusi.
Dalam simulasi percobaan pencocokan, variabel acaknya adalah banyaknya kecocokan. Untuk nilai \(n\) yang dipilih (banyaknya bola), jalankan simulasi 1.000 kali dan bandingkan simpangan baku sampel dengan simpangan baku distribusi.
Jalankan simulasi percobaan gamma 1.000 kali untuk berbagai nilai parameter laju \(r\) dan parameter bentuk \(k\). Bandingkan simpangan baku sampel dengan simpangan baku distribusi.
Misalkan \(X\) memiliki fungsi kepadatan probabilitas \(f(x) = 12 \, x^2 \, (1 - x)\) untuk \(0 \le x \le 1\). Distribusi \(X\) merupakan anggota keluarga beta. Hitung masing-masing berikut ini
Sekarang, misalkan \((X_1, X_2, \ldots, X_{10})\) merupakan sampel acak berukuran 10 dari distribusi beta dalam . Tentukan masing-masing berikut ini:
Misalkan \(X\) memiliki fungsi kepadatan probabilitas \(f(x) = \lambda e^{-\lambda x}\) untuk \(0 \le x \lt \infty\), dengan \(\lambda \gt 0\) sebagai parameter. Jadi, \(X\) memiliki distribusi eksponensial dengan parameter laju \(\lambda\). Hitung masing-masing berikut ini
Sekarang, misalkan \((X_1, X_2, \ldots, X_5)\) merupakan sampel acak berukuran 5 dari distribusi eksponensial dalam . Tentukan masing-masing berikut ini:
Ingat bahwa untuk dadu tak seimbang yang mengutamakan sisi 1 dan 6, sisi 1 dan 6 masing-masing memiliki probabilitas \(\frac{1}{4}\), sedangkan sisi 2, 3, 4, dan 5 masing-masing memiliki probabilitas \(\frac{1}{8}\). Misalkan \(X\) menyatakan skor ketika dadu pipih satu-enam dilempar. Hitung masing-masing berikut ini:
Sekarang, misalkan dadu tak seimbang yang mengutamakan sisi 1 dan 6 dilempar 8 kali. Tentukan masing-masing berikut ini:
Perangkat lunak statistika sebaiknya digunakan untuk soal-soal dalam subbagian ini.
Tinjau variabel panjang mahkota bunga dan spesies dalam data iris Fisher.
Tinjau variabel erosi dalam himpunan data Challenger.
Tinjau data kecepatan cahaya Michelson.
Tinjau data paralaks matahari Short.
Tinjau data densitas bumi Cavendish.
Tinjau data M&M.
Tinjau variabel berat tubuh, spesies, dan jenis kelamin dalam data tonggeret.
Tinjau data tinggi Pearson.