Du har fem målinger fra et forsøg: temperaturen i et rum (x) og en plantess vækst i cm (y). Du afbilder punkterne i et koordinatsystem og kan se, at de stort set stiger fra venstre mod højre. Men ingen af punkterne ligger præcis på en ret linje. Lineær regression er den metode, der finder den bedste rette linje gennem netop sådan et sæt data og hjælper dig med at beskrive sammenhængen matematisk.
Du møder lineær regression i gymnasiets matematik-undervisning, særligt på B- og A-niveau i statistikforlobet, men også i samfundsfag og biologi, når man vil undersøge, om der er en sammenhæng mellem to variable. Her får du en trin-for-trin gennemgang: hvad lineær regression er, hvordan mindste kvadraters metode virker, hvad R² fortæller dig, og hvordan du aflæser et residualplot.
Hvad er lineær regression?
Nøglebegreb
Lineær regression
Lineær regression er en statistisk metode, der bestemmer den rette linje y = ax + b, som bedst beskriver et sæt datapunkter. Linjen kaldes også tendenslinjen eller regressionslinjen, og den er bestemt ved mindste kvadraters metode.
Eksempel: Har du målt spændingen over en modstand ved fem forskellige strømstyrker, kan lineær regression finde den forskrift, der samlet set ligger tættest på alle fem målepunkter.
Ideen er, at du har en tabel med samhørende x- og y-værdier og mistanke om en tilnærmelsesvis lineær sammenhæng. Lineær regression bestemmer de to konstanter: a, hjældningskoefficienten, og b, skæringen med y-aksen. Så du får en funktionsforskrift på formen \( f(x) = ax + b \), og netop den linje passer bedst muligt til dine data.
Den forklarende variabel, også kaldet den uafhængige variabel, placeres på x-aksen. Det er den variabel, du mener påvirker den anden. Den afhængige variabel placeres på y-aksen. Undersøger du, om antallet af gødningsenheder (x) påvirker afgrødens højde (y), er gødningsmngden din forklarende variabel.
Xy-plottet: tegn dine data, inden du regner
Inden du tænker på formler, tegner du et xy-plot. Et xy-plot er et punktdiagram, hvor hvert datapunkt \( (x_i,\, y_i) \) sættes ind i et koordinatsystem med x på førstepladsen og y på andenpladsen. Plottet giver dig et visuelt overblik: stiger punkterne jævnt fra venstre mod højre, er en lineær model et godt udgangspunkt. Danner de en bue eller en sky uden mønster, er lineær regression sandsynligvis ikke den rigtige model.
Xy-plot med tendenslinje for f(x) = 0,9x + 1,3
De blå punkter i xy-plottet ovenfor viser de fem målinger: (1, 2), (2, 3), (3, 5), (4, 4) og (5, 6). Den røde linje er regressionslinjen \( f(x) = 0{,}9x + 1{,}3 \). Du kan se, at punkterne tilnærmelsesvis følger en ret linje, hvilket er et godt tegn på, at en lineær model giver mening for dette datamæriale.
Mindste kvadraters metode: idéen bag regressionslinjen
Tænk over dette: du har plottet dine punkter og tegnet en vilkårlig ret linje igennem dem. For hvert datapunkt \( (x_i,\, y_i) \) kan du måle den lodrette afstand ned til linjen. Den afstand kalder vi et residual og skriver \( r_i = y_i - \hat{y}_i \), hvor \( \hat{y}_i \) er linjens værdi i punktet. Problemet er, at nogle residualer er positive (punktet ligger over linjen) og andre negative (punktet ligger under), og de kan ophave hinanden, hvis vi bare lægger dem sammen.
Løsningen er at kvadrere hvert residual. Et kvadrat er altid positivt, og en stor afstand giver et stort kvadrat. Nu lægger vi alle de kvadrerede residualer sammen: \( \sum_{i=1}^{n} r_i^2 \). Den linje, der giver den mindst mulige sum, er regressionslinjen. Metoden kalder vi mindste kvadraters metode, og den er den matematiske kerne i lineær regression.
Eksempelopgave
Tre punkter: (1, 2), (3, 5) og (5, 4). Kontroller, at regressionslinjen f(x) = 0,9x + 1,3 giver en kvadratsum på 4,28.
Vis løsningSkjul løsning
- 1
Beregn de tre forudsagte værdier
Vi indsætter x-værdierne i forskriften f(x) = 0,9x + 1,3 for at finde linjens værdier.
\[ \hat{y}_1 = 0{,}9 \cdot 1 + 1{,}3 = 2{,}2 \qquad \hat{y}_2 = 0{,}9 \cdot 3 + 1{,}3 = 4{,}0 \qquad \hat{y}_3 = 0{,}9 \cdot 5 + 1{,}3 = 5{,}8 \] - 2
Beregn residualerne
Residualet er afstanden fra det observerede punkt ned til linjen.
\[ r_1 = 2 - 2{,}2 = -0{,}2 \qquad r_2 = 5 - 4{,}0 = 1{,}0 \qquad r_3 = 4 - 5{,}8 = -1{,}8 \] - 3
Summer de kvadrerede residualer
Vi kvadrerer hvert residual og lægger dem sammen. Jo større sum, jo dårligere passer linjen.
\[ (-0{,}2)^2 + (1{,}0)^2 + (-1{,}8)^2 = 0{,}04 + 1{,}00 + 3{,}24 = 4{,}28 \]
Formlerne for a og b
Mindste kvadraters metode giver os to formler, som beregner a og b direkte fra data. De kræver, at du forst beregner middelværdierne \( \bar{x} \) og \( \bar{y} \) samt to summer. Herunder er formlerne, og nedenunder dem er et konkret udregningseksempel.
Formel
Hjældningskoefficienten a i lineær regression
Variable
| Symbol | Navn |
|---|---|
| \(n\) | Antal datapunkter |
| \(\bar{x}\) | Middelværdi af x-værdierne |
| \(\bar{y}\) | Middelværdi af y-værdierne |
Formel
Skæringen b i lineær regression
Variable
| Symbol | Navn |
|---|---|
| \(\bar{y}\) | Middelværdi af y-værdierne |
| \(a\) | Den beregnede hjældningskoefficient |
| \(\bar{x}\) | Middelværdi af x-værdierne |
Eksempelopgave
Fem datapunkter: (1, 2), (2, 3), (3, 5), (4, 4), (5, 6). Bestem regressionslinjen y = ax + b ved hjælp af mindste kvadraters metode.
Vis løsningSkjul løsning
- 1
Beregn middelværdierne
Vi summerer alle x-værdier og dividerer med antallet af punkter n = 5. Samme procedure for y.
\[ \bar{x} = \frac{1+2+3+4+5}{5} = 3 \qquad \bar{y} = \frac{2+3+5+4+6}{5} = 4 \] - 2
Beregn de to summer
Vi beregner summen af produkterne xi*yi og summen af xi i anden potens.
\[ \sum x_i y_i = 1{\cdot}2 + 2{\cdot}3 + 3{\cdot}5 + 4{\cdot}4 + 5{\cdot}6 = 2 + 6 + 15 + 16 + 30 = 69 \] \[ \sum x_i^2 = 1 + 4 + 9 + 16 + 25 = 55 \] - 3
Indsæt i formlen og beregn a
Vi indsætter tallene fra trin 1 og 2 i formlen for a.
\[ a = \frac{69 - 5 \cdot 3 \cdot 4}{55 - 5 \cdot 3^2} = \frac{69 - 60}{55 - 45} = \frac{9}{10} = 0{,}9 \] - 4
Beregn b
Nu indsætter vi den fundne værdi for a samt middelværdierne.
\[ b = \bar{y} - a \cdot \bar{x} = 4 - 0{,}9 \cdot 3 = 4 - 2{,}7 = 1{,}3 \] - 5
Skriv regressionslinjen
Den bedste rette linje for vores data er nu bestemt.
\[ f(x) = 0{,}9x + 1{,}3 \]
Determinationskoefficienten R²
Når du har din regressionslinje, vil du gerne vide, hvor godt den faktisk beskriver dine data. Prøv at forestille dig to scenarier: i det første ligger alle punkter meget tæt på linjen, i det andet er de spredt ud i en tyk sky. Begge scenarier kan give en regressionslinje, men den første er selvfølgelig mere brugbar. Det er præcis det, R² måler.
Formel
Determinationskoefficienten R²
Variable
| Symbol | Navn |
|---|---|
| \(y_i\) | Observeret y-værdi |
| \(\hat{y}_i\) | Modellens forudsagte y-værdi |
| \(\bar{y}\) | Middelværdi af alle y-værdier |
I vores eksempel med f(x) = 0,9x + 1,3 er SSres = 1,90 og SStot = 10, så R² = 1 - 1,90/10 = 0,81. Det betyder, at modellen forklarer 81 % af variationen i y-værdierne. De resterende 19 % skyldes variation, som modellen ikke fanger. På A-niveau forventes du også at kunne vurdere, om residualerne er normalfordelte, men det er ikke et krav på B-niveau.
Husk
Et højt R² er ingen garanti for, at en lineær model er den rigtige. Er xy-plottet tydeligt buet, men R² alligevel høj, kan det skyldes, at en eksponentiel eller potensmodel ville passe endnu bedre. Brug altid xy-plottet og residualplottet i kombination med R².
Residualplot og modelkontrol
Residualet for et datapunkt er den lodrette afstand fra punktet til regressionslinjen: \( r_i = y_i - \hat{y}_i \). Et residualplot viser disse residualer langs y-aksen med de tilhørende x-værdier langs x-aksen. Den vandrette linje ved y = 0 svarer til, at residualet er nul, dvs. punktet ligger præcis på regressionslinjen.
Et godt residualplot ser tilfældigt ud: punkterne er spredt jævnt på begge sider af x-aksen uden et tydeligt mønster. Et dårligt residualplot har et systematisk mønster, fx en bue. Det er et tegn på, at den lineære model ikke passer til data, og at en anden model, fx eksponentiel regression, ville give en bedre beskrivelse. Ifgl. UVMs vejledning til matematik B-læreplanen skal du kunne give en kvalitativ vurdering af residualplottet og afgøre, om afvigelserne er systematiske eller tilfældige.
- 1
Tegn xy-plottet
Afbild alle datapunkter i et koordinatsystem. Vurder visuelt, om de tilnaermelsesvis følger en ret linje.
- 2
Lav lineær regression
Brug GeoGebra, Excel eller Maple til at beregne a, b og R² for din data.
- 3
Beregn residualerne
For hvert datapunkt (xi, yi) beregnes residualet: ri = yi - (a*xi + b).
- 4
Tegn residualplottet
Plot punkterne (xi, ri) i et nyt koordinatsystem med en vandret linje ved y = 0.
- 5
Vurder residualplottet
Tilfældig spredning: god model. Tydeligt mønster eller bue: overvej en anden modeltype.
Residualplot for f(x) = 0,9x + 1,3
Lineær regression i GeoGebra: trin for trin
GeoGebra er det mest brugte digitale værktøj til lineær regression i gymnasiet. Det beregner automatisk a, b og R² og tegner regressionslinjen i dit koordinatsystem. Maple og Excel kan det samme, men GeoGebra er oftest det hurtigste valg til en skriftlig eksamen.
- 1
1. Åbn GeoGebra Regneark
Gå til GeoGebra Classic (geogebra.org/classic). Klik på 'Regneark' i venstre menu. Skriv dine x-værdier i kolonne A og y-værdier i kolonne B.
- 2
2. Markeré dine data og vælg regressionsanalyse
Markeré begge kolonner med musen. Giv til menuén og vælg 'Sandsynlighed og statistik', derefter 'To variable regressionsanalyse'.
- 3
3. Vælg 'Lineær' som model
I dialogboksen der åbner, vælg 'Lineær' i rullemenuen 'Regressionsmodel'. GeoGebra viser straks a, b og R².
- 4
4. Aflæs og noter resultaterne
Kopieres forskriften f(x) = ax + b og R²-værdien. Tag et skærmbillede til din opgave.
- 5
5. Tegn residualplottet
Luk regressionsværktøjet og brug kommandoen ResidualPlot(liste1, f) i inputfeltet i GeoGebra. Residualplottet vises automatisk i koordinatsystemet.
Samvariation er ikke det samme som årsagssammenhæng
Forestil dig, at en forsker finder en meget høj positiv korrelation og R² = 0,93 mellem antallet af is der sælges i Danmark (x) og antallet af drukneulykker (y). Ingen ville mene, at isælget forarsager drukneulykker. Begge variable stiger simpelthen med temperaturen om sommeren. Det er et eksempel på samvariation drevet af en bagvedliggende variabel, ikke en direkte årsagssammenhæng.
Lineær regression kan kun dokumentere, at der er en statistisk sammenhæng mellem to variable, aldrig at den ene forarsager den anden. For at tale om kausalitet kræves en faglig og teoretisk begrundelse. Det gaelder især i samfundsfag og biologi, men også når du bruger andre statistiske værktøjer som binomialfordelingen. Husk: lineær regression er et værktøj til kontinuerte variable, ikke til diskrete sandsynlighedsmodeller.
Husk på eksamen
Lineær regression viser samvariation, ikke årsagssammenhæng. Når du bruger regressionsanalyse i en opgave, skal du altid inddrage faglig teori for at argumentere for, om en årsagssammenhæng er plausibel.
Slår lineær regression knuder i dit hoved?
Hos Toptutors sidder over 1.000 erfarne tutorer klar til at hjælpe dig. 96 % af vores elever giver positiv feedback, og du kan booke en gratis prøvetime uden binding, fra 229 kr. pr. time.
Quiz
Test din viden om lineær regression
Svar på de fire spørgsmål herunder og se, om du har styr på de vigtigste begreber.
1. Hvad minimerer mindste kvadraters metode?
2. Hvad fortaeller R² = 0,85 dig?
3. Et højt R² beviser, at den ene variabel forarsager den anden variabel.
4. Hvad viser et residualplot?
Ofte stillede spørgsmål om lineær regression