Skip to main content
ECONOMETRIE
CURS 2

IAŞI
- 2013-
Structurarea pe cursuri a tematicii
Regresia liniară simplă
(C2)
1. Scurt istoric al regresiei. Tipuri de modele de regresie
2. Prezentarea modelului de regresie liniară simplă
3. Estimarea parametrilor modelului liniar
4. Estimarea indicatorilor de corelaţie
(C3)
5. Testarea parametrilor modelului liniar
6. Testarea indicatorilor de corelaţie
7. Testarea modelului liniar

2
1.Scurt istoric al regresiei (I)
1805 - A.M. Legendre, Nouvelles méthodes pour la détermination
des orbites des comètes. "Sur la Méthode des moindres quarrés"
apare ca anexă.
1809 - C.F. Gauss, Theoria Motus Corporum Coelestium in
Sectionibus Conicis Solem Ambientum.
1821/1823 - C.F. Gauss. Theoria combinationis observationum
erroribus minimis obnoxiae
1869 - Charles Darwin, The Variation of Animals and Plants under
Domestication. (Capitolul XIII descrie ceea ce era cunoscut ca reversie
in perioada lui Galton. Darwin utilizează termenul de "reversie".)
1877 - Francis Galton, "Typical laws of heredity", Nature 15, pp.
492 495, 512-514, 532-533. (Galton utilizează termenul de "reversie"
în articolele sale, în care tratează mărimea boabelor de mazăre.)
3
1.Scurt istoric al regresiei (II)
1885 - Francis Galton, Presidential address, Section H,
Anthropology. (Galton utilizează termenul de "regresie" în lucrările
sale, în care abordează problema înălţimii oamenilor)
1886 - Francis Galton,. "Regression Towards Mediocrity in
Hereditary Stature," Journal of the Anthropological Institute, nr. 15,
pp. 246-263. (Facsimile at: [2])
1897 - G. U. Yule, "On the Theory of Correlation", Journal of the
Royal Statistical Society , pp. 812-54.
1903 - Karl Pearson, G. U. Yule, Norman Blanchard, and Alice
Lee. "The Law of Ancestral Heredity", Biometrika
1922 - R.A. Fisher, "The goodness of fit of regression formulae,
and the distribution of regression coefficients", Journal of the
Royal Statistical Society, pp. 85, 597-612
1925 - R.A. Fisher, Statistical Methods for Research Workers
4
2. Prezentarea modelului de regresie
liniară simplă (1)
Analiza de regresie studiază legătura statistică între două sau
mai multe variabile statistice sub aspectul formei acesteia.
În legăturile statistice utilizăm variabile aleatoare (stohastice),
ceea ce înseamnă că variabilelor le corespund distribuţii de
probabilitate.
În legăturile de tip funcţional sau deterministic unei valori i se
asociază o altă valoare şi nu o distribuţie de probabilitate.

Analiza de corelaţie studiază legătura statistică între două sau
mai multe variabile statistice sub aspectul intensităţii acesteia.
5
Interpretarea geometrică şi statistică a regresiei (1)
Interpretarea geometrică
Exemplu
 Se consideră repartiţia a 50 de firme după profitul realizat (Y,
variabilă dependentă, sute mil. lei) şi cheltuielile cu publicitatea
(X, variabilă independentă, mil. lei).



Pe baza datelor de mai sus, putem construi 5 repartiţii
condiţionate
6
Interpretarea geometrică şi statistică a regresiei (2)

7
Interpretarea geometrică şi statistică a regresiei (3)


Mediile condiţionate corespunzătoare celor 5 repartiţii:

8
Interpretarea geometrică şi statistică a regresiei (4)


Interpretarea statistică

Regresia este o medie condiţionată, definită prin relaţia:
M(Y/X=xi) = f(xi) sau M(Y/X)=f(x)
Pentru cazul liniar, regresia este o funcţie liniară:

M(Y│X) = β0+β1X
Prin urmare, regresia liniară este:
yi = M(Y/X=xi) = β0+β1xi

9
2. Prezentarea modelului de regresie
liniară simplă (2)
Forma generală a unui model de regresie este: M(Y│X)=f(x).
Pentru modelul de regresie liniară simplă forma modelului
devine:
M(Y│X) = β0+β1X ,unde M(Y│X) – media condiţionată
corespunzătoare variabilei stohastice Y iar β0 şi β1 sunt parametrii
modelului.
În cele mai multe cazuri, valorile reale yi diferă de valorile
aşteptate sau teoretice M(Y│X=xi).
Abaterea valorilor reale faţă de valorile teoretice reprezintă
valorile variabilei stohastice, ε, denumită eroare de modelare.
εi = yi - M(Y│X=xi) => yi = M(Y│X=xi) + εi = β0+ β1xi + εi sau
Y= β0+ β1X + ε
10
2. Prezentarea modelului de regresie
liniară simplă (3)
Componentele modelului de regresie liniar sunt:
1. Componenta deterministă este reprezentată de media
condiţionată M(Y│X=xi) = β0+ β1xi
2. Componenta aleatoare ε depinde de: natura fenomenului,
specificarea modelului şi erorile de măsurare.
a. Natura imprevizibilă a fenomenului dă naştere la erori
de modelare.
b. Specificarea incompletă a modelului determină apariţia
erorilor de modelare.
c. Erorile de măsurare sunt şi ele surprinse prin eroarea
de modelare.

11
2. Prezentarea modelului de regresie
liniară simplă (4)
Parametrii modelului de regresie liniar sunt:.
1. β0 - reprezintă constanta sau termenul liber al modelului şi
reprezintă valoarea medie a variabilei Y atunci când X=0.
Grafic parametrul β0 reprezintă intersecţia dreptei de regresie
liniară cu axa OY (engl. intercept).
2. β1- reprezintă variaţia medie a variabilei dependente, Y, la
o creştere cu o unitate a variabilei independente, X. β1 mai
poartă denumirea şi de tangentă a pantei dreptei sau simplu
pantă a dreptei (engl. slope) şi arată cu cât variază Y dacă X
creşte cu o unitate.
dY ∆Y
β1 =
=
dX ∆X
Dacă β1>0 => există o legătură directă între variabila Y şi
variabila X, dacă β1<0 => există o legătură inversă între
variabila Y şi variabila X iar dacă β1=0 nu există legătură între
Y şi X.
12
2. Prezentarea modelului de regresie
liniară simplă (5)
Ipoteze clasice ale modelului de regresie
1. Ipoteze cu privire la eroarea de modelare
ε i ~ N ( 0 ,σ 2 ) , adică variabila
- normalitatea erorilor:
reziduală urmează o lege de repartiţie normală de medie zero şi
varianţă σ2;
2
2
- homoscedasticitate: V ( ε i ) = M ( ε i ) = σ ,adică varianţa
erorii este constantă la nivelul distribuţiilor condiţionate de
tipul Yi X = xi ;
- necorelarea erorilor: cov(ε i , ε j ) = 0, i ≠ j; i, j = 1, n ,adică
erorile nu se influenţează reciproc;
- lipsa corelaţiei dintre variabila independentă şi
variabila eroare: cov( ε i , xi ) = 0 .

13
2. Prezentarea modelului de regresie
liniară simplă (6)
2. Ipotezele cu privire la variabila independentă:
- variabila independentă X este observabilă (nestochastică);
- variabila independentă are o variaţie finită şi posibil de calculat;
- variabilele independente (pentru cazul regresiei multiple) nu trebuie să
fie coliniare.
Modelul yi =
estimatorilor

β 0 + β1 xi + ε i la nivelul unui eşantion poate fi scris pe baza
ˆ
ˆ
ˆ
ˆ
ˆ
yi = β 0 + β1 xi + ε i sau y i = y i + ε i .

unde:
-

ˆ
ˆ
ˆ
y i = β 0 + β 1 xi este estimatorul mediei condiţionate M(Y│X=xi);

-

ˆ
β1 este estimatorul parametrului β1

ˆ
β
- β 0 este estimatorul parametrului 0
-

)
εi

este estimatorul erorii stohastice εi

Particular, pentru un eşantion observat, modelul de regresie liniară
yi = b0 + b1 xi + ei
simplă poate fi scris:
14
3. Estimarea parametrilor modelului
liniar (1)
1. Estimarea punctuală a parametrilor modelului liniar
Estimarea parametrilor modelului de regresie poate fi făcută
utilizând metoda celor mai mici pătrate (MCMMP).
Criteriul care stă la baza metodei celor mai mici pătrate constă în
minimizarea n
pătratelor erorii de modelare:
2
n
n
n
2
ˆ
ˆ
ˆ
ˆ
ˆ
ˆ 2
S = ∑ ε i2 = ∑ ( yi − yi ) = ∑ yi − ( β 0 + β1 xi ) = ∑ yi − β 0 − β1 xi = min .
i =1

i =1

i =1

(

)

i =1

(

)

Rezolvarea acestei probleme de minim presupune îndeplinirea a
două condiţii:

ˆ
1. Anularea derivatelor parţiale de ordinul I ale lui S în raport cu β 0
∂S
∂S
ˆ
β1 :
= 0 şi
=0
şi
ˆ
ˆ
∂β 0
∂β1
2. Matricea derivatelor parţiale de
ordinul doi să fie pozitiv definită:

 ∂2S
 2
ˆ
 ∂ β0
det  2
∂ S

 ∂β ∂β
ˆ ˆ
 0 1

∂2S 

ˆ ∂β 
ˆ
∂β 0 1
2
>0
∂ S

2 ˆ
∂ β1 


15
3. Estimarea parametrilor modelului
liniar (2)
ˆ
1. Anularea derivatelor parţiale de ordinul I ale lui S în raport cu β 0
ˆ
şi β1:
n
n
n

(

)

(

)

∂S
ˆ
ˆ
= 2∑ yi − β0 − β1 xi ( −1) = 0
ˆ
∂β0
i =1

⇒

n
∂S
ˆ
ˆ
= 2∑ yi − β0 − β1 xi ( − xi ) = 0
∂β1
i =1

ˆ
β0

∑ y ∑x −∑x ∑x y
=
n∑ x − ( ∑ x )
i

2
i

2
i

i

i

2

i

i

,

ˆ
ˆ
nβ0 + β1 ∑xi = ∑ yi
i =1

i =1

n

n

i =1

i =1

n

ˆ
ˆ
β0 ∑xi + β1 ∑x = ∑ yi xi
2
i

i =1

ˆ = n∑ xi yi − ∑ xi ∑ yi
β1
2
n∑ xi2 − ( ∑ xi )

ˆ
ˆ
β 0 = y − β1 x
2. Matricea derivatelor parţiale de ordinul doi să fie pozitiv definită:
n
∑ xi 


2
∑ x ∑ x
i
i 

Este pozitiv definită deoarece n ∑ x i2 − ( ∑ x i ) = n 2σ 2 > 0
2

16
3. Estimarea parametrilor modelului
liniar (3)
Estimatorii parametrilor modelului de regresie sunt variabile de
selecţie care:
-urmează

(

)

2
ˆ
o distribuţie normală: β 0~ N β 0 , σ βˆ0 ,

-

sunt nedeplasaţi:

-

convergenţi:

( βˆ )

( )

( )

(

2
ˆ
β1 ~ N β1 , σ βˆ

1

)

ˆ
ˆ
M β 0 = β 0 , M β1 = β1

0 n∈N

→ β0 ,

( βˆ )

1 n∈N

→ β1

ˆ
eficienţi: dintre toţi estimatorii posibili pentru β1 , β1 are
varianţa cea mai mică
-

17
3. Estimarea parametrilor modelului
liniar (4)
2. Estimarea prin interval de încredere a parametrilor modelului
liniar
Atât pentru β 0 , cât şi pentru β1 , intervalele de încredere se vor
construi pentru un nivel de încredere de (1-α):

ˆ
ˆ
β 0 ∈ [ β 0 ± tα / 2,n − k σ βˆ ]
0

ˆ
ˆ
β 1 ∈ [ β 1 ± tα / 2,n − k σ βˆ ]
1

Pe baza datelor de la nivelul unui eşantion se vor utiliza
estimaţiile parametrilor:

[

β 0 ∈ b0 ± tα / 2,n− k sβˆ

0

]

[

β1 ∈ b1 ± tα / 2,n− k sβˆ

1

]

unde k = numărul parametrilor estimaţi în model (pentru
modelul liniar k=2),
n = volumul eşantionului pe baza căruia se fac estimările.

18
3. Estimarea parametrilor modelului
liniar (5)
Abaterile standard ale estimatorilor şi estimaţiile acestora se
determină după relaţiile:


2


1

x
2
2
1

x2

ˆ
ˆ2
, respectiv sβˆ0 = sβˆ0 = s  +
σ β = σ βˆ = σ 2  +
2 
n ∑ ( xi − x ) 2 

 n ∑ ( xi − x ) 
i


i


0

0

ˆ
ˆ2
σ β1 = σ βˆ =
1

ˆ
σ

2

n

( xi − x) 2
∑

2
sβˆ = sβˆ =
, respectiv 1
1

s2
n

∑ ( x − x)
i =1

i =1

2

,

i

σ2
unde ˆ

este estimatorul varianţei erorii de modelare, iar s 2 este
estimaţia acestuia:

ˆ
σ

2

∑ εˆ
=

2
i

n−2

=

ˆ
ˆ
( yi − β 0 − β1 xi ) 2
∑
n−2

s2 =
, respectiv

ei2
∑

n−2

=

( yi − b0 − b1 xi ) 2
∑
n−2

19
4. Estimarea indicatorilor de corelaţie (1)
1. Coeficientul de corelaţie (se foloseşte doar pentru modelul
N
liniar):
∑ ( xi − µ x )( yi − µ y )
cov( X , Y ) i =1
ρ ( X ,Y ) =
=
, -1≤ρ≤+1
σ xσ y
Nσ xσ y
n

ˆ
ρ ( X ,Y ) ≅ r =

∑ ( xi − x )( yi − y )

i =1

ns x s y

n

=

n

n

i =1

i =1

i =1

n ∑ xi yi − ∑ xi ∑ yi
n

n

n

n

[ n ∑ x − ( ∑ xi ) ][ n ∑ y ( ∑ yi )2 ]
i =1

2
i

i =1

2

i =1

2
i

i =1

2. Raportul de determinaţie:
ˆ
∑ ( y i − y ) 2 VE
V
η 2= i
=
= 1 − R , cu 0<η2<1
VT
∑ ( yi − y ) 2 VT
i

O estimaţie a raportului de determinaţie se obţine prin relaţia:
∑ (b0 + b1 x − y ) 2 ESS
RSS
2
i
R =
=
= 1−
2
TSS
TSS
∑ ( yi − y )
i

20
4. Estimarea indicatorilor de corelaţie
(2)

VT = ∑( yi - y )2, reprezintă variaţia totală (TSS);
ˆ
VE = ∑ (yi - y )2, reprezintă variaţia explicată (ESS);
i
ˆ ,
VR = ∑( y i - yi )2 reprezintă variaţia reziduală (RSS).
Variaţia totală este egală cu suma celorlalte două variaţii
componente: VT=VE +VR
3. Raportul de corelaţie:

η = η2

21
5.

Exemple de modele liniare simple în teoria economică

Funcţia de consum
-cererea sau consumul populaţiei în funcţie de venit:

Ci = β 0 + β1Vi + ε i

, unde parametrul β1 arată cu cât creşte
Ci
consumul unui anumit produs ( ) la o creştere cu o unitate a
venitului şi este de regulă pozitiv.
Legea cererii
-cererea populaţiei în funcţie de preţul acestor produse:
Ci = β 0 + β1 Pi + ε i
, unde parametrul β1 este de regulă negativ şi
arată cu cât scade cererea la o creştere a preţului cu o unitate.

22
EXEMPLU


Se consideră datele cu privire la
Valoarea vânzărilor şi
Cheltuielile cu publicitatea
pentru un eşantion de 4 firme.
Datele sunt prezentate în
tabelul următor.

xi

yi

10
20
50
100

2500
4100
5000
7500

180

19100

23
a
Coefficients

Model
1

(Constant)
chelt_publicitate

Unstandardized
Coefficients
B
Std. Error
-45.163
15.015
.019
.003

Standardized
Coefficients
Beta
.977

t
-3.008
6.422

Sig.
.095
.023

95% Confidence Interval for B
Lower Bound Upper Bound
-109.766
19.439
.006
.032

a. Dependent Variable: Val_vanzari

Correlations

Model Summary
Model
1

R
.977a

R Square
.954

Adjusted
R Square
.931

a. Predictors: (Constant), chelt_publicitate

vanzari

Std. Error of
the Estimate
10.64486

vanzari

chelt_publ

Pearson Correlation
Sig. (2-tailed)
N
Pearson Correlation
Sig. (2-tailed)
N

1
4
.977*
.023
4

chelt_publ
.977*
.023
4
1
4

*. Correlation is significant at the 0.05 level (2-tailed).

24