Du har fem målinger fra et forsøg: temperaturen i et rum (x) og en plantess vækst i cm (y). Du afbilder punkterne i et koordinatsystem og kan se, at de stort set stiger fra venstre mod højre. Men ingen af punkterne ligger præcis på en ret linje. Lineær regression er den metode, der finder den bedste rette linje gennem netop sådan et sæt data og hjælper dig med at beskrive sammenhængen matematisk.

Du møder lineær regression i gymnasiets matematik-undervisning, særligt på B- og A-niveau i statistikforlobet, men også i samfundsfag og biologi, når man vil undersøge, om der er en sammenhæng mellem to variable. Her får du en trin-for-trin gennemgang: hvad lineær regression er, hvordan mindste kvadraters metode virker, hvad R² fortæller dig, og hvordan du aflæser et residualplot.

Hvad er lineær regression?

Nøglebegreb

Lineær regression

Lineær regression er en statistisk metode, der bestemmer den rette linje y = ax + b, som bedst beskriver et sæt datapunkter. Linjen kaldes også tendenslinjen eller regressionslinjen, og den er bestemt ved mindste kvadraters metode.

Eksempel: Har du målt spændingen over en modstand ved fem forskellige strømstyrker, kan lineær regression finde den forskrift, der samlet set ligger tættest på alle fem målepunkter.

Ideen er, at du har en tabel med samhørende x- og y-værdier og mistanke om en tilnærmelsesvis lineær sammenhæng. Lineær regression bestemmer de to konstanter: a, hjældningskoefficienten, og b, skæringen med y-aksen. Så du får en funktionsforskrift på formen \( f(x) = ax + b \), og netop den linje passer bedst muligt til dine data.

Den forklarende variabel, også kaldet den uafhængige variabel, placeres på x-aksen. Det er den variabel, du mener påvirker den anden. Den afhængige variabel placeres på y-aksen. Undersøger du, om antallet af gødningsenheder (x) påvirker afgrødens højde (y), er gødningsmngden din forklarende variabel.

Xy-plottet: tegn dine data, inden du regner

Inden du tænker på formler, tegner du et xy-plot. Et xy-plot er et punktdiagram, hvor hvert datapunkt \( (x_i,\, y_i) \) sættes ind i et koordinatsystem med x på førstepladsen og y på andenpladsen. Plottet giver dig et visuelt overblik: stiger punkterne jævnt fra venstre mod højre, er en lineær model et godt udgangspunkt. Danner de en bue eller en sky uden mønster, er lineær regression sandsynligvis ikke den rigtige model.

Xy-plot med tendenslinje for f(x) = 0,9x + 1,3

De blå punkter i xy-plottet ovenfor viser de fem målinger: (1, 2), (2, 3), (3, 5), (4, 4) og (5, 6). Den røde linje er regressionslinjen \( f(x) = 0{,}9x + 1{,}3 \). Du kan se, at punkterne tilnærmelsesvis følger en ret linje, hvilket er et godt tegn på, at en lineær model giver mening for dette datamæriale.

Mindste kvadraters metode: idéen bag regressionslinjen

Tænk over dette: du har plottet dine punkter og tegnet en vilkårlig ret linje igennem dem. For hvert datapunkt \( (x_i,\, y_i) \) kan du måle den lodrette afstand ned til linjen. Den afstand kalder vi et residual og skriver \( r_i = y_i - \hat{y}_i \), hvor \( \hat{y}_i \) er linjens værdi i punktet. Problemet er, at nogle residualer er positive (punktet ligger over linjen) og andre negative (punktet ligger under), og de kan ophave hinanden, hvis vi bare lægger dem sammen.

Løsningen er at kvadrere hvert residual. Et kvadrat er altid positivt, og en stor afstand giver et stort kvadrat. Nu lægger vi alle de kvadrerede residualer sammen: \( \sum_{i=1}^{n} r_i^2 \). Den linje, der giver den mindst mulige sum, er regressionslinjen. Metoden kalder vi mindste kvadraters metode, og den er den matematiske kerne i lineær regression.

Eksempelopgave

Tre punkter: (1, 2), (3, 5) og (5, 4). Kontroller, at regressionslinjen f(x) = 0,9x + 1,3 giver en kvadratsum på 4,28.

Vis løsning
  1. 1

    Beregn de tre forudsagte værdier

    Vi indsætter x-værdierne i forskriften f(x) = 0,9x + 1,3 for at finde linjens værdier.

    \[ \hat{y}_1 = 0{,}9 \cdot 1 + 1{,}3 = 2{,}2 \qquad \hat{y}_2 = 0{,}9 \cdot 3 + 1{,}3 = 4{,}0 \qquad \hat{y}_3 = 0{,}9 \cdot 5 + 1{,}3 = 5{,}8 \]
  2. 2

    Beregn residualerne

    Residualet er afstanden fra det observerede punkt ned til linjen.

    \[ r_1 = 2 - 2{,}2 = -0{,}2 \qquad r_2 = 5 - 4{,}0 = 1{,}0 \qquad r_3 = 4 - 5{,}8 = -1{,}8 \]
  3. 3

    Summer de kvadrerede residualer

    Vi kvadrerer hvert residual og lægger dem sammen. Jo større sum, jo dårligere passer linjen.

    \[ (-0{,}2)^2 + (1{,}0)^2 + (-1{,}8)^2 = 0{,}04 + 1{,}00 + 3{,}24 = 4{,}28 \]

Formlerne for a og b

Mindste kvadraters metode giver os to formler, som beregner a og b direkte fra data. De kræver, at du forst beregner middelværdierne \( \bar{x} \) og \( \bar{y} \) samt to summer. Herunder er formlerne, og nedenunder dem er et konkret udregningseksempel.

Formel

Hjældningskoefficienten a i lineær regression

\[a = \frac{\displaystyle\sum_{i=1}^{n} x_i y_i - n \cdot \bar{x} \cdot \bar{y}}{\displaystyle\sum_{i=1}^{n} x_i^2 - n \cdot \bar{x}^2}\]

Variable

SymbolNavn
\(n\)Antal datapunkter
\(\bar{x}\)Middelværdi af x-værdierne
\(\bar{y}\)Middelværdi af y-værdierne
Hvornår: Brug denne formel når du skal bestemme hjældningen af regressionslinjen ud fra rådata.
\[a = \frac{\displaystyle\sum_{i=1}^{n} x_i y_i - n \cdot \bar{x} \cdot \bar{y}}{\displaystyle\sum_{i=1}^{n} x_i^2 - n \cdot \bar{x}^2}\]

Formel

Skæringen b i lineær regression

\[b = \bar{y} - a \cdot \bar{x}\]

Variable

SymbolNavn
\(\bar{y}\)Middelværdi af y-værdierne
\(a\)Den beregnede hjældningskoefficient
\(\bar{x}\)Middelværdi af x-værdierne
Hvornår: Beregn altid b efter a. Regressionslinjen skærer altid gennemsnittpunktet \( (\bar{x}, \bar{y}) \).
\[b = \bar{y} - a \cdot \bar{x}\]

Eksempelopgave

Fem datapunkter: (1, 2), (2, 3), (3, 5), (4, 4), (5, 6). Bestem regressionslinjen y = ax + b ved hjælp af mindste kvadraters metode.

Vis løsning
  1. 1

    Beregn middelværdierne

    Vi summerer alle x-værdier og dividerer med antallet af punkter n = 5. Samme procedure for y.

    \[ \bar{x} = \frac{1+2+3+4+5}{5} = 3 \qquad \bar{y} = \frac{2+3+5+4+6}{5} = 4 \]
  2. 2

    Beregn de to summer

    Vi beregner summen af produkterne xi*yi og summen af xi i anden potens.

    \[ \sum x_i y_i = 1{\cdot}2 + 2{\cdot}3 + 3{\cdot}5 + 4{\cdot}4 + 5{\cdot}6 = 2 + 6 + 15 + 16 + 30 = 69 \] \[ \sum x_i^2 = 1 + 4 + 9 + 16 + 25 = 55 \]
  3. 3

    Indsæt i formlen og beregn a

    Vi indsætter tallene fra trin 1 og 2 i formlen for a.

    \[ a = \frac{69 - 5 \cdot 3 \cdot 4}{55 - 5 \cdot 3^2} = \frac{69 - 60}{55 - 45} = \frac{9}{10} = 0{,}9 \]
  4. 4

    Beregn b

    Nu indsætter vi den fundne værdi for a samt middelværdierne.

    \[ b = \bar{y} - a \cdot \bar{x} = 4 - 0{,}9 \cdot 3 = 4 - 2{,}7 = 1{,}3 \]
  5. 5

    Skriv regressionslinjen

    Den bedste rette linje for vores data er nu bestemt.

    \[ f(x) = 0{,}9x + 1{,}3 \]

Determinationskoefficienten R²

Når du har din regressionslinje, vil du gerne vide, hvor godt den faktisk beskriver dine data. Prøv at forestille dig to scenarier: i det første ligger alle punkter meget tæt på linjen, i det andet er de spredt ud i en tyk sky. Begge scenarier kan give en regressionslinje, men den første er selvfølgelig mere brugbar. Det er præcis det, R² måler.

Formel

Determinationskoefficienten R²

\[R^2 = 1 - \frac{\displaystyle\sum_{i=1}^{n}(y_i - \hat{y}_i)^2}{\displaystyle\sum_{i=1}^{n}(y_i - \bar{y})^2}\]

Variable

SymbolNavn
\(y_i\)Observeret y-værdi
\(\hat{y}_i\)Modellens forudsagte y-værdi
\(\bar{y}\)Middelværdi af alle y-værdier
Hvornår: R² bruges til at vurdere, hvor stor en del af variationen i y-værdierne den lineære model forklarer. Værdien ligger altid mellem 0 og 1.
\[R^2 = 1 - \frac{\displaystyle\sum_{i=1}^{n}(y_i - \hat{y}_i)^2}{\displaystyle\sum_{i=1}^{n}(y_i - \bar{y})^2}\]

I vores eksempel med f(x) = 0,9x + 1,3 er SSres = 1,90 og SStot = 10, så R² = 1 - 1,90/10 = 0,81. Det betyder, at modellen forklarer 81 % af variationen i y-værdierne. De resterende 19 % skyldes variation, som modellen ikke fanger. På A-niveau forventes du også at kunne vurdere, om residualerne er normalfordelte, men det er ikke et krav på B-niveau.

Husk

Et højt R² er ingen garanti for, at en lineær model er den rigtige. Er xy-plottet tydeligt buet, men R² alligevel høj, kan det skyldes, at en eksponentiel eller potensmodel ville passe endnu bedre. Brug altid xy-plottet og residualplottet i kombination med R².

Residualplot og modelkontrol

Residualet for et datapunkt er den lodrette afstand fra punktet til regressionslinjen: \( r_i = y_i - \hat{y}_i \). Et residualplot viser disse residualer langs y-aksen med de tilhørende x-værdier langs x-aksen. Den vandrette linje ved y = 0 svarer til, at residualet er nul, dvs. punktet ligger præcis på regressionslinjen.

Et godt residualplot ser tilfældigt ud: punkterne er spredt jævnt på begge sider af x-aksen uden et tydeligt mønster. Et dårligt residualplot har et systematisk mønster, fx en bue. Det er et tegn på, at den lineære model ikke passer til data, og at en anden model, fx eksponentiel regression, ville give en bedre beskrivelse. Ifgl. UVMs vejledning til matematik B-læreplanen skal du kunne give en kvalitativ vurdering af residualplottet og afgøre, om afvigelserne er systematiske eller tilfældige.

  1. 1

    Tegn xy-plottet

    Afbild alle datapunkter i et koordinatsystem. Vurder visuelt, om de tilnaermelsesvis følger en ret linje.

  2. 2

    Lav lineær regression

    Brug GeoGebra, Excel eller Maple til at beregne a, b og R² for din data.

  3. 3

    Beregn residualerne

    For hvert datapunkt (xi, yi) beregnes residualet: ri = yi - (a*xi + b).

  4. 4

    Tegn residualplottet

    Plot punkterne (xi, ri) i et nyt koordinatsystem med en vandret linje ved y = 0.

  5. 5

    Vurder residualplottet

    Tilfældig spredning: god model. Tydeligt mønster eller bue: overvej en anden modeltype.

Residualplot for f(x) = 0,9x + 1,3

Lineær regression i GeoGebra: trin for trin

GeoGebra er det mest brugte digitale værktøj til lineær regression i gymnasiet. Det beregner automatisk a, b og R² og tegner regressionslinjen i dit koordinatsystem. Maple og Excel kan det samme, men GeoGebra er oftest det hurtigste valg til en skriftlig eksamen.

  1. 1

    1. Åbn GeoGebra Regneark

    Gå til GeoGebra Classic (geogebra.org/classic). Klik på 'Regneark' i venstre menu. Skriv dine x-værdier i kolonne A og y-værdier i kolonne B.

  2. 2

    2. Markeré dine data og vælg regressionsanalyse

    Markeré begge kolonner med musen. Giv til menuén og vælg 'Sandsynlighed og statistik', derefter 'To variable regressionsanalyse'.

  3. 3

    3. Vælg 'Lineær' som model

    I dialogboksen der åbner, vælg 'Lineær' i rullemenuen 'Regressionsmodel'. GeoGebra viser straks a, b og R².

  4. 4

    4. Aflæs og noter resultaterne

    Kopieres forskriften f(x) = ax + b og R²-værdien. Tag et skærmbillede til din opgave.

  5. 5

    5. Tegn residualplottet

    Luk regressionsværktøjet og brug kommandoen ResidualPlot(liste1, f) i inputfeltet i GeoGebra. Residualplottet vises automatisk i koordinatsystemet.

Samvariation er ikke det samme som årsagssammenhæng

Forestil dig, at en forsker finder en meget høj positiv korrelation og R² = 0,93 mellem antallet af is der sælges i Danmark (x) og antallet af drukneulykker (y). Ingen ville mene, at isælget forarsager drukneulykker. Begge variable stiger simpelthen med temperaturen om sommeren. Det er et eksempel på samvariation drevet af en bagvedliggende variabel, ikke en direkte årsagssammenhæng.

Lineær regression kan kun dokumentere, at der er en statistisk sammenhæng mellem to variable, aldrig at den ene forarsager den anden. For at tale om kausalitet kræves en faglig og teoretisk begrundelse. Det gaelder især i samfundsfag og biologi, men også når du bruger andre statistiske værktøjer som binomialfordelingen. Husk: lineær regression er et værktøj til kontinuerte variable, ikke til diskrete sandsynlighedsmodeller.

Husk på eksamen

Lineær regression viser samvariation, ikke årsagssammenhæng. Når du bruger regressionsanalyse i en opgave, skal du altid inddrage faglig teori for at argumentere for, om en årsagssammenhæng er plausibel.

Slår lineær regression knuder i dit hoved?

Hos Toptutors sidder over 1.000 erfarne tutorer klar til at hjælpe dig. 96 % af vores elever giver positiv feedback, og du kan booke en gratis prøvetime uden binding, fra 229 kr. pr. time.

Få en gratis prøvetime

Quiz

Test din viden om lineær regression

0/4 besvaret

Svar på de fire spørgsmål herunder og se, om du har styr på de vigtigste begreber.

1. Hvad minimerer mindste kvadraters metode?

2. Hvad fortaeller R² = 0,85 dig?

3. Et højt R² beviser, at den ene variabel forarsager den anden variabel.

4. Hvad viser et residualplot?

Ofte stillede spørgsmål om lineær regression

Hvad er lineær regression?
Lineær regression er en statistisk metode, der bestemmer den rette linje y = ax + b, som bedst beskriver et saet datapunkter. 'Bedst' defineres ved mindste kvadraters metode, som minimerer summen af de kvadrerede lodrette afstande fra datapunkterne til linjen. Metoden bruges til at beskrive og forudsige sammenhange mellem to variable.
Hvad er determinationskoefficienten R², og hvordan fortolkes den?
R² er et tal mellem 0 og 1, der angiver, hvor stor en del af variationen i y-værdierne den lineære model forklarer. R² = 1 betyder, at alle punkter ligger præcis på regressionslinjen. R² = 0,81 betyder, at modellen forklarer 81 % af variationen. Husk, at et højt R² ikke garanterer, at en lineær model er den rigtige: tjek altid også xy-plottet og residualplottet.
Hvad er forskellen på korrelation og kausalitet i lineær regression?
Korrelation betyder, at to variable samvarierer statistisk. Kausalitet betyder, at den ene variabel forarsager den anden. Lineær regression kan kun vise korrelation. For at argumentere for kausalitet skal du have en faglig og teoretisk begrundelse, ikke blot en høj R²-værdi.
Hvad er et residualplot, og hvornaar bruger man det?
Et residualplot viser residualerne (afstanden fra hvert datapunkt til regressionslinjen) som funktion af x-værdierne. Det bruges til at vurdere, om den valgte model er passende: et tilfældigt spredt residualplot tyder på en god model, mens et systematisk mønster (fx en bue) tyder på, at en anden modeltype ville passe bedre.
Hvordan laver man lineær regression i GeoGebra?
Abn GeoGebra Classic og ga til Regneark. Skriv dine x-værdier i kolonne A og y-værdier i kolonne B. Markeré begge kolonner, vaelg 'Sandsynlighed og statistik' og klik på 'To variable regressionsanalyse'. Vaelg 'Lineaær' som model, og GeoGebra beregner automatisk a, b og R².
Hvad er mindste kvadraters metode?
Mindste kvadraters metode er den matematiske metode bag lineær regression. For enhver ret linje kan man beregne residualerne: de lodrette afstande fra hvert datapunkt til linjen. Mindste kvadraters metode finder de vaerdier af a og b, der giver den mindst mulige sum af kvadrerede residualer, og den linje er regressionslinjen.