Übung 3
Herzlich Willkommen zur Übung Statistik 5. Diese diese Übung wendet die Funktionen aus den erstzen zwei Übungen an um Konfidenzintervalle anzuschauen. Auch die for-Schleife werden wir wieder nutzen.Wir bleiben dabei zunächst bei der Normalverteilung und \(\chi^2\)-Verteilung, auch wenn Konfidenzintervalle basierend auf t-Werten bessere Schätzungen liefern könnten.
In der Vorlesung haben wir uns bereits die Idee des Konfidenzintervalls angeschaut, jetzt wollen wir uns diese auf Basis von Simulationen nochmals anschauen.
Grundsätzlich sind Konfidenzintervalle definiert über den zugehörigen Standardfehler. Für den Mittelwert ist dies (falls die Populationsvarianz bekannt ist): \[\overline x \pm z_{1-\frac{\alpha}{2}}*\sigma_{\overline x}\] Das Konfidenzintervall hat dann die Grenzen \[[\overline x - z_{1-\frac{\alpha}{2}}*\sigma_{\overline x},\overline x + z_{1-\frac{\alpha}{2}}*\sigma_{\overline x}]\] Wenn nicht, sollten wir die t-Verteilung verwenden (nächste/übernächste Woche).
\(z_{1-\frac{\alpha}{2}}\) ist der Wert der Normalverteilung (\(z\)) für eine bestimmte Konfidenz (\(1-\frac{Signifikanz\quad oder\quad\alpha-Fehler}{2}\)). Wir müssen \(\alpha\) wieder halbieren, da wir ein zweiseitiges Konfidenzintervall berechnen wollen. Bei einem einseitigen Konfidenzintervall sind die Grenzen dagegen: \([-\infty,\overline x + z_{1-\alpha}*\sigma_{\overline x}]\) oder \([\overline x - z_{1-\alpha}*\sigma_{\overline x},+\infty]\)
Ziehen Sie für jeden der folgenden Populationsparameter 20 Stichproben aus einer Normalverteilung.
Bestimmen Sie mittel jeweils die 5000 Mittelwert je Verteilung und weisen Sie das Ergebnis wie folgt einem Datensatz zu (ersetzen Sie die Angaben in BLOCKSCHRIFT durch Ihre eigenen Variablen) und die Nummer des Datensatz durch die Verteilung, für den Sie den Datensatz erstellen.
Wie unterscheiden sich die Standardfehler und warum?
Bestimmen Sie nun die Standardfehler des Mittelwerts \(\sigma_{\overline x}= \frac{\sigma}{\sqrt n}\) für die drei Verteilungen:
Bestimmen Sie jetzt jeweils \(z_{1-\frac{\alpha}{2}}*\sigma_{\overline x}\) für ein 90%-Konfidenzintervall, ein 95%Konfidenzintervall, ein 99%-Konfidenzintervall und ein 100% Konfidenzintervall. Vergessen Sie nicht, dass Sie den zugehörigen z-Wert mittels qnorm() bestimmen können.
| Konfidenz | Verteilung 1 | Verteilung 2 | Verteilung 3 | |||
|---|---|---|---|---|---|---|
| \(90\%\) | ||||||
| \(95\%\) | ||||||
| \(99\%\) |
Wann ist das Konfidenzintervall am grössten, wann am kleinsten?
Sie werden jetzt insgesamt 2 neue Spalten für jeden Datensatz (basierend auf dem 90%-Konfidenzintervall) berechnen:
wobei uG die untere Grenze und oG die obere Grenze des Konfidenzintervalls sein soll.
Berechnen Sie jetzt beide Spalten für alle drei Verteilungen. Denken Sie daran, dass Sie die Mittelwerte bereits in den Datensätzen haben.
Jetzt soll das Ergebnis visualisiert werden. Eventuell müssen Sie zuvor das Package ggplot2 installieren. Danach können Sie den folgenden Code direkt ausführen. Falls Sie die Datensätze oder die Variablen im Datensatz angepasst haben, müssen Sie natürlich diese Anpassungen auch hier vornehmen. Für die beiden anderen Datensätze müssen Sie nur die zweite Zeile anpassen (Datensatz2 und Datensatz3).
Jeder Graph stellt die Konfidenzintervalle (horizontale Linien), Stichprobenmittelwerte (Punkte) und den wahren Mittelwert in der Population (senkrechte Linie) dar. Vergleichen Sie die Graphen, was fällt Ihnen auf? Was verraten Ihnen diese Graphen. Was würde sich ändern, wenn Sie das 95%-Konfidenzintervall verwendet hätten?
Auch für die Varianz von Stichproben können Konfidenzintervalle berechnet werden, genau genommen für jede Statistik (zumindest theoretisch).
Wir wissen, dass die Varianz einer normalverteilten Population \(\chi^2\)-verteilt ist.
\[\frac{(n-1)^2*s^2}{\sigma^2}\sim\chi^2_{n-1}\]
Das Konfidenzintervall der Varianz hat dann die Grenzen: \[[\frac{(n-1)*s^2}{\chi^2_{1-\frac{\alpha}{2},n-1}},\frac{(n-1)*s^2}{\chi^2_{\frac{\alpha}{2},n-1}}]\]
Die \(\chi^2\)-Verteilung ist nicht symmetrisch, daher benötigen wir diesmal zwei Werte aus der Verteilung. Beachten Sie, dass der grössere \(\chi^2\)-Wert mit der unteren Grenze assoziert ist, da durch diesen dividiert wird.
Für das Konfidenzintervall der Standardabweichung wäre die Rechnung identisch, es muss nur jeweils noch die Wurzel gezogen werden.
Fügen Sie für jeden Datensatz eine Spalte Var_SP hinzu, die sich aus den Varianzen der simulierten Stichproben ergibt.
Bestimmen Sie anschliessend die benötigten Kennwerte der \(\chi^2\)-Verteilung für ein 90%-Konfidenzintervall für \(n=10\) und \(n=30\).
Stichprobe mit \(n=10\)
\(\chi^2_{1-\frac{\alpha}{2},n-1} = \quad\)
\(\chi^2_{\frac{\alpha}{2},n-1} = \quad\)
Stichprobe mit \(n=30\)
\(\chi^2_{1-\frac{\alpha}{2},n-1} = \quad\)
\(\chi^2_{\frac{\alpha}{2},n-1} = \quad\)
Berechnen Sie jetzt jeweils eine Spalte Var_uG_90 und Var_oG_90 für jeden Datensatz für die untere und obere Grenze des Konfidenzintervalls jeder Stichprobe.
Kopieren Sie Ihren R-Code für die Konfidenzintervalle der Mittelwerte. Passen Sie ihn an, dass er stattdessen die Konfidenzintervalle der Varianzen visualisiert. Achten Sie auf den Namen des Datensatzes, die verwendeten Variablen/Spalten und das \(\sigma^2\) statt \(\mu\) eingezeichnet werden muss.
Stellen Sie die Grenzen der x-Achse mit xlim() auf 0 und 1500 ein. Damit können Sie die Graphen gut vergleichen.
Schauen Sie sich die Graphen an, was fällt Ihnen auf, wenn Sie die Graphen miteinander vergleichen? Was fällt Ihnen auf im Vergleich zu den Graphen der Mittelwerte?