---
title: "Statistik 3"
subtitle: "Übung 1"
format: 
  revealjs:
    chalkboard:
      remember-playback: true
      create-playback: true
    slide-number: true
    #embed-resources: true
    css: 
     - webex.css
     - statistics_exercises_reveal.css
    include-after-body: 
      - webex.js
      - webex-pdf-persist.js
    height: 1200
    width: 1800
webexercises:
  storage-key: "Uebung_Statistik3_1"
---

```{r setup}
#| include: false
library("exams2forms")
knitr::opts_knit$set("out.format" = NULL, "rmarkdown.pandoc.to" = NULL)
```

## Einleitung und Ziele der Übung

Herzlich Willkommen zur Übung Statistik 3. Diese erste Übung dient der Wiederholung der einfachen linearen Regression. Vieles wird Ihnen sicherlich vertraut vorkommen. Häufig sind es auch Sachen, die Studierende in der Prüfung bzw. unter Stress gerne falsch machen.

## Agenda

-   Kurze Vorstellung Ihres Übungsleiter\*in und ihrer/-s Tutor\*in
-   Visualisieren von Zusammenhängen und deren Interpretation
-   Bestimmen von Regressionskoeffizienten schriftlich (mit Taschenrechner)
-   Regressionen in R durchführen und auf statistische Signifikanz prüfen
-   Überprüfung von Voraussetzungen/Annahmen und Interpretation des R-Outputs

## 1. Visualisieren von Zusammenhängen und deren Interpretation 1

\

Betrachten Sie folgende Graphen. Entscheiden Sie jeweils ob ein linearer Zusammenhang bestehen könnte. Was spricht dafür, was spricht dagegen. Überlegen Sie erst allein und tauschen Sie sich anschliessend mit Ihren Sitznachbar\*innen aus.
```{r}
#| echo: false
#| message: false
#| results: "asis"
#| warning: false
# Reproduzierbarkeit
set.seed(854463)
# Anzahl Beobachtungen
n <- 100
# Unabhängige Variable
X1 <- rnorm(100, 50, 20)
# Lineare Zusammenhänge
X2 <- 2 * X1 + rnorm(n, mean = 0, sd = 15)
X3 <- -2 * X1 + rnorm(n, mean = 0, sd = 35)
# Logarithmische Zusammenhänge
X4 <- 20 * log(X1) + rnorm(n, mean = 0, sd = 2)
X5 <- 20 * log(X1) + rnorm(n, mean = 0, sd = 10)
# Exponentielle Zusammenhänge
X6 <- 5 * exp(X1 / 40) + rnorm(n, mean = 0, sd = 5)
X7 <- 5 * exp(X1 / 40) + rnorm(n, mean = 0, sd = 50)
# Datensatz erzeugen
df <- data.frame(
X1,X5,X7,X3,X6,X4,X2
)
colnames(df) <- sprintf("X%i",1:7)
plot(df)
remove(n,X1,X2,X3,X4,X5,X6,X7)
```
## 1. Visualisieren von Zusammenhängen und deren Interpretation 2

\

Wie Sie sicherlich gesehen haben, gab es einige Zusammenhänge die eindeutlig linear aussahen,
z.B. X1 und X4, X1 und X7, X4 und X7.\

Genauso gab es einige Zusammenhänge die eindeutlig nicht linear aussahen,
z.B. X1 und X6, X6 und X7, X3 und X6.\

Es gibt aber einen grossen Graubereich, hier muss dann entweder inhaltlich entschieden werden oder es müssen genauere Analysen erfolgen.

\
Diese Daten werden später nochmals im Rahmen der Analyse mit R genauer angeschaut.

## 2. Bestimmen von Regressionskoeffizienten mit dem Taschenrechner 1

\
  Jetzt sollen Sie als nächstes nochmal Regressionskoeffizienten mit Taschenrechner und per Hand bestimmen.
  Dafür sollen nur die Daten von 4 Personen verwendet werden und Merkmal 1 durch Merkmal 2 vorhergesagt werden.
  
  | Person | Merkmal 1 | Merkmal 2 |
  |----------|------------|------------|
  |A|5|11|
  |B|3|7|
  |C|5|10|
  |D|7|8|
  
  Überlegen Sie zunächst selbstständig, welche Werte Sie berechnen müssen (und welche Werte Sie dafür benötigen).
  Nutzen Sie dann die Formelsammlung für Statistik 3 um die Koeffizienten zu bestimmen.
  Auf der nächsten Seite finden Sie eine Eingabemaske, mit der Sie Ihre Zwischenergebnisse überprüfen können. 

  
## 2. Bestimmen von Regressionskoeffizienten mit dem Taschenrechner 2

\
  Es wird alles auf 2 Nachkommastellen gerundet und mit diesen Werten weitergerechnet.
  Bitte geben Sie die Nachkommastellen auch an, selbst wenn diese 0 sind.
  
  Z.B. 10.00 statt 10
  
  | Wert |  | Ergebnis |
|---------------|---|---------------------------|
| $\overline x$ |  = | `r forms_string("9.00", width = 7, obfuscate = FALSE)` |
| $\overline y$  | = | `r forms_string("5.00", width = 7, obfuscate = FALSE)` |
| $\hat \sigma^2_X$  | = | `r forms_string("3.33", width = 7, obfuscate = FALSE)` |
| $\hat \sigma_{XY}$  | = | `r forms_string("0.67", width = 7, obfuscate = FALSE)` |
| $b_1$ | = | `r forms_string("0.20", width = 7, obfuscate = FALSE)` |
| $b_0$  | = | `r forms_string("3.20", width = 7, obfuscate = FALSE)` |

\
Schreiben Sie anschliessend die Regressionsgleichung mit den eingesetzten Koeffizienten auf!
(Hinweis: Grossbuchstaben; den Fehler und die Nachkommastellen nicht vergessen!)\

`r forms_string("Y = 3.20 + 0.20 * X + E", width = 75, obfuscate = FALSE)`

## 2. Bestimmen von Regressionskoeffizienten mit dem Taschenrechner 3

\ 

Was sagen $b_0$ und $b_1$ jeweils inhaltlich aus? Wie stehen $b_1$ und $r$ inhaltlich zueinander (in der einf. lin. Reg.)?
Überlegen Sie sich jeweils kurz eine Antwort auf die 3 Aspekte.

## 3. Regressionen in R durchführen und auf statistische Signifikanz prüfen 1

\ 

Jetzt gehen wir zurück auf die Zusammenhänge vom Anfang. Laden Sie zunächst den Datensatz **Uebung_Statistik3_1A.csv**
herunter und importieren Sie Ihn nach R mit dem df. Er sollte aus 100 Zeilen und 7 Variablen bestehen.

Adaptieren Sie anschliessend den untenstehenden Code um sich das Ergebnis für die Regression von folgenden drei Varianten anzuschauen.

- X3 vorhergesagt durch X1
- X4 vorhergesagt durch X1
- X6 vorhergesagt durch X1

```{r}
#| eval: false
#| echo: true
RegressionAVUV <- lm(AV ~ UV, DATENSATZ)
summary(RegressionAVUV)
```


Sobald Sie die drei Summaries haben, sind sie bereit für die nächste Aufgabe.

## 3. Regressionen in R durchführen und auf statistische Signifikanz prüfen 2

\
  Bitte auf 2 Nachkommastellen runden, ausser bei *p*-Werten, dort 3 Nachkommastellen.
 
  Bitte geben Sie die Nachkommastellen auch an, selbst wenn diese 0 sind.
  
  Bei Werten, deren Minimum nur 0 oder -1 betragen kann und ihr Maximum 1, ist die führende 0 wegzulassen.
  
|AV  | Wert |  | Ergebnis |
|---------------|---------------|---|---------------------------|
|X3| $b_0$ |  = | `r forms_string("3.60", width = 7, obfuscate = FALSE)` |
|X4| $b_1$  | = | `r forms_string("-2.01", width = 7, obfuscate = FALSE)` |
|X3| $R^2$  | = | `r forms_string(".03", width = 7, obfuscate = FALSE)` |
|X6| ${df}_{b_0}$  | = | `r forms_string("97", width = 7, obfuscate = FALSE)` |
|X4| ${df}_{b_0}$ | = | `r forms_string("98", width = 7, obfuscate = FALSE)` |
|X3| $p_{b_1}$  | = | `r forms_string(".091", width = 7, obfuscate = FALSE)` |

\

Auf der nächsten Seite geht es weiter.

## 3. Regressionen in R durchführen und auf statistische Signifikanz prüfen 3

\
  Warum unterscheiden sich die Freiheitsgrade der Regressionen?

\ 

  Welche Koeffizienten sind signifikant für $\alpha = .05$, welche für $\alpha = .10$?

\  

  Warum können Sie die Regressionskoeffizienten zwischen den Modellen nicht direkt vergleichen, 
  um zu unterscheiden, welche Variable am besten durch X1 vorhergesagt wird? Was bräuchten wir um dies zu tun?

\  

  Wie können Sie sich die Residuen ausgeben lassen, wie die geschätzten Werte?

\  

  Wie gross ist der geschätzte Wert für X4, wenn X1 den Wert 5 hat? `r forms_string("-3.83", width = 7, obfuscate = FALSE)`


## 4. Überprüfung von Voraussetzungen/Annahmen und Interpretation des R-Outputs - 1

\
Schauen Sie zunächst nochmals nach, wie Streudiagramme für unsere drei Regressionen aussahen.
Im Idealfall sollten wir bei der Prüfung der Annahmen, Verletzungen entdecken, wenn das Streudiagramm auch schon nicht linear aussah.

Lassen Sie sich die Diagramme zur Überprüfung der Annahmen für jeder der Regressionen nach folgendem Schema ausgeben.

\


```{r}
#| eval: false
#| echo: true
library(performance)
check_model(RegressionAVUV)
```

\

Vergleichen Sie anschliessend die Ergebnisse für die verschiedenen Regressionen.
Welches Regression erfüllt die Annahmen am besten, welches eigentlich gar nicht und welches ist noch in Ordnung aus ihrer Sicht? Begründen Sie. Was bedeutet dies für die Durchführbarkeit der Regressionen und die erzielten Ergebnisse?
