Teorema del límit central
En matemàtiques, el Teorema del límit central (o Teorema central del límit) indica que la distribució de la suma estandarditzada de variables aleatòries independents que tenen una variància finita tendeix a una distribució normal estàndard quan el nombre de termes de la suma creix indefinidament. Com a conseqüència d'aquest teorema, s'explica el fet que moltes variables aleatòries siguin aproximadament normals i justifica la importància teòrica i pràctica de la distribució normal.
Aquest teorema, pertanyent a la Teoria de la probabilitat, troba aplicació en molts camps relacionats, com ara l'Estadística inferencial o la Teoria de renovació.
Teorema
Enunciat
Existeixen diverses versions del teorema (segons les hipòtesis escollides). L'enunciat més simple és aquest:
Donada una successió <math>(X_n)_{\,n\, \in\, \mathbb{N}^\ast}</math> de variables aleatòries (definides sobre el mateix espai de probabilitat) independents i idènticament distribuïdes (abreujadament i.i.d), amb variància finita, es posa:
- <math>\ \mu = \operatorname{E}(X_n)</math> i <math>\sigma = \sqrt{\operatorname{Var}(X_n)}</math>, on se suposa que <math>\sigma</math> és diferent de 0.
Si es defineix per a tot n:
- <math>\overline{X_n} = \frac{X_1 + \cdots + X_n}{n}</math> i
- <math>\overline{X_n}\,^\ast =\frac{\overline{X_n} - \operatorname{E}\left(\overline{X_n}\right)}{\sqrt{\operatorname{Var}\left(\overline{X_n}\right)}} = \frac{\overline{X_n} - \mu}{\left(\frac{\sigma}{\sqrt{n}}\right)} </math> (variable aleatòria estandarditzada associada a <math>\overline{X_n} </math>)
aleshores la successió <math>\Big(\overline{X_n}\,^\ast\Big)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard.
Altrament dit:
- <math>\forall\, t \in \mathbb{R}, \mathbb{P}\left(\overline{X_n}\,^\ast \leq t\right) \to \Phi(t)</math> quan <math>n \to +\infty</math> (vegeu límit d'una successió),
on <math>\Phi</math> és la funció de distribució normal: per a tot real t,
- <math>\ \Phi(t) = \int_{-\infty}^{\,t}\frac{1}{\sqrt{2\,\pi}}\,\mathrm{e}^{-\frac{u^2}{2}}\, du </math>.
Remarca: un enunciat lleugerament diferent (però equivalent) és aquest, amb les mateixes hipòtesis:
Si es defineix per a tot n:
- <math>S_n = X_1 + \cdots + X_n</math> i
- <math>S_n^\ast =\frac{S_n - \operatorname{E}\left(S_n\right)}{\sqrt{\operatorname{Var}\left(S_n\right)}} = \frac{S_n - n\,\mu}{\sigma\, \sqrt{n}} </math> (variable aleatòria estandarditzada associada a <math>S_n </math>)
aleshores la successió <math>\left(S_n^\ast\right)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard.
Altrament dit:
- <math>\forall\, t \in \mathbb{R}, \mathbb{P}\left(S_n^\ast \leq t\right) \to \Phi(t)</math> quan <math>n \to +\infty</math>.
(en efecte, és clar que per a tot n, <math>S_n^\ast = \overline{X_n}\,^\ast </math>).
Interpretació
En estadística, el teorema del límit central s'interpreta i s'utilitza així: sigui <math>X_1</math>, <math>X_2</math>, ..., <math>X_n</math> una mostra aleatòria de mida n d'una distribució amb mitjana μ i variància σ2 finites (σ ≠ 0).
Llavors, si n és suficientment gran (una condició freqüent és: <math>n \geq 30</math>):
- la variable aleatòria <math>\overline{X} =\frac{1}{n}\sum_{i=1}^{n}X_i</math> (mitjana mostral) té aproximadament una distribució normal amb mitjana <math>\mu_{\overline{X}} = \mu</math> i variància <math>\sigma_{\overline{X}}^2 = \sigma^2 / n</math>;
- també es compleix que la variable aleatòria <math>S = X_1 + \cdots + X_n</math> té aproximadament una distribució normal amb mitjana <math>\mu_S = n\, \mu</math> i variància <math>{\sigma_S}^2 = n \sigma^2</math>.
Com més gran sigui el valor de n, millor serà l'aproximació. L'aproximació entre les dues distribucions és, en general, major en el centre que en els extrems o cues, motiu pel qual s'anomena "Teorema del límit central" ("central" fa referència al límit de la successió estandarditzada, més que no al teorema).
Importància pràctica
Aquesta propietat d'aproximació té aplicacions pràctiques importants. Sovint, no es coneix la distribució "exacta" d'una variable aleatòria, però es pot aproximar per una distribució normal; fins i tot quan es coneix la distribució exacta, pot resultar més senzill aproximar-la per una distribució normal — sempre que sigui justificat.
Demostració del teorema de Lindeberg-Lévy
Per demostrar aquest teorema, s'utilitza les funcions característiques i el teorema de continuïtat de Lévy.
Se sap que si el moment d'ordre m de X existeix (finit), aleshores:
- <math>\forall\, t \in \mathbb{R},\,\varphi_X(t) = \left(\sum_{k = 0}^m \frac{i^k\, \operatorname{E}(X^k)}{k\,!}\, t^k\right) + t^m\, \varepsilon_m(t)</math> , on <math>\varepsilon_m(t) \to 0\text{ quan }t\to 0 </math>.
En particular, si <math>\ \operatorname{E}(X) = 0 </math> i <math>\ \operatorname{Var}(X) = 1 </math>, aleshores:
- <math>\forall\, t \in \mathbb{R},\,\varphi_X(t) = 1 - \frac{t^2}{2} + t^2\, \varepsilon(t)</math> , on <math>\varepsilon(t) \to 0\text{ quan }t\to 0 </math>.
Per a tota variable aleatòria T amb variància finita i no nul·la, es nota per <math>T^\ast</math> la variable aleatòria estandarditzada associada:
- <math>T^\ast = \frac{T - \operatorname{E}(T)}{\sqrt{\operatorname{Var}(T)
</math>.
Ara es comença la demostració pròpiament dita. Per a tot n:
- <math>S_n^\ast = \frac{S_n - n\, \mu}{\sigma\,\sqrt{n}} = \frac{X_n + \cdots + X_n - n\, \mu}{\sigma\,\sqrt{n}} = \frac{1}{\sqrt{n}}\, \sum_{k = 1}^n \frac{X_k - \mu}{\sigma}</math>,
es a dir:
- <math>S_n^\ast = \frac{1}{\sqrt{n}}\, \sum_{k = 1}^n X_k^\ast</math>;
d'on:
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) = \operatorname{E}\left(\mathrm{e}^{\,i\, t\, S_n^\ast}\right) = \operatorname{E}\left(\mathrm{e}^{i\, \frac{t}{\sqrt{n}}\,(X_1^\ast + \cdots + X_n^\ast\,)}\right) = \operatorname{E}\left(\,\prod_{k = 1}^n\mathrm{e}^{i\, \frac{t}{\sqrt{n}}X_k^\ast}\right)</math>.
A més, com que <math>X_1</math>, <math>X_2</math>, ..., <math>X_n</math> són independents i idènticament distribuïdes, també ho són les variables aleatòries <math>X_1^\ast</math>, <math>X_2^\ast</math>, ..., <math>X_n^\ast</math>; per tant:
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) = \prod_{k = 1}^n \operatorname{E}\left(\mathrm{e}^{i\, \frac{t}{\sqrt{n}}X_k^\ast}\right) = \prod_{k = 1}^n \varphi_{X_k^\ast}\left(\frac{t}{\sqrt{n}}\right) </math> (per independència de <math>X_1^\ast</math>, <math>X_2^\ast</math>, ..., <math>X_n^\ast</math>) i
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) = \left[\varphi_{X_1^\ast}\left(\frac{t}{\sqrt{n}}\right)\right]^n</math> (tots els factors són iguals, car corresponen a variables aleatòries idènticament distribuïdes).
D'altra part:
- <math>\forall\, t \in \mathbb{R},\, \varphi_{X_1^\ast}(t)= 1 - \frac{t^2}{2} + t^2\, \varepsilon(t)</math> , on <math>\varepsilon(t) \to 0\text{ quan }t\to 0 </math>
- (recordem que <math>\ \operatorname{E}(X_1^\ast) = 0 </math> i <math>\ \operatorname{Var}(X_1^\ast) = 1 </math> ).
Per consegüent:
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) = \left[\varphi_{X_1^\ast}\left(\frac{t}{\sqrt{n}}\right)\right]^n = \left[1 - \frac{t^2}{2\, n} + \frac{t^2}{n}\, \varepsilon\left(\frac{t}{\sqrt{n}}\right)\right]^n</math>.
Se'n dedueix que quan <math>n \to +\infty </math>,
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) \to \mathrm{e}^{-\frac{t^2}{2}}\, ; </math>
- en efecte, si <math>\left(u_n\right)_{\, n\, \in\, \mathbb{N}^\ast}</math> és una successió real o complexa tal que <math>u_n \to \alpha</math>, on <math>\alpha</math> és un nombre real o complex, aleshores:
Ara bé, si una variable aleatòria T és normal estàndard, la seva funció característica <math> \varphi_T </math> és tal que:
- <math>\forall\, t \in \mathbb{R},\, \varphi_T(t) = \mathrm{e}^{-\frac{t^2}{2}}\, ; </math>
finalment hem provat que:
- <math>\forall\, t \in \mathbb{R},\, \varphi_{S_n^\ast}(t) \to \varphi_T(t)\text{ quan }n \to +\infty</math>.
Segons el teorema de continuïtat de Lévy, la convergència en distribució equival a la convergència puntual de les funcions característiques: per tant, la successió <math>\left(S_n^\ast\right)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard. Això acaba la prova del teorema de Lindeberg-Lévy.}}
Il·lustració gràfica

Densitat de probabilitat inicial
La densitat de probabilitat <math>f_1</math> representada aquí és discontínua i no té cap simetria. Si una variable aleatòria segueix la distribució definida per aquesta densitat, aleshores la seva mitjana és 0 i la seva variància és 1.
Considerem aquí variables aleatòries independents i idènticament distribuïdes <math>X_1</math>, <math>X_2</math>, <math>X_3</math> ... que segueixen la distribució definida per aquesta densitat.

Suma de dues variables aleatòries
Després determinem la densitat <math>f_2</math> de <math>S_2 = X_1 + X_2</math> (per convolució de <math>f_1</math> per <math>f_1</math>).
La densitat de probabilitat representada és la de la variable aleatòria estandarditzada <math>S_2^\ast</math> associada a <math>S_2</math>.
Aquesta densitat ja és més regular (més "llisa") que la densitat inicial. Tanmateix, s'hi veuen punts angulosos.

Suma de tres variables aleatòries
Després determinem la densitat <math>f_3</math> de <math>S_3 = X_1 + X_2 + X_3</math> (per convolució de <math>f_1</math> per <math>f_2</math>).
La densitat de probabilitat representada és la de la variable aleatòria estandarditzada <math>S_3^\ast</math> associada a <math>S_3</math>.
Aquesta densitat és encara més regular que la precedent.

Suma de quatre variables aleatòries
Finalment, determinem la densitat <math>f_4</math> de <math>S_4 = X_1 + X_2 + X_3 + X_4</math> (per convolució de <math>f_1</math> per <math>f_3</math>).
La densitat de probabilitat representada és la de la variable aleatòria estandarditzada <math>S_4^\ast</math> associada a <math>S_4</math>.
A ull nu, no es pot distingir aquesta densitat de la densitat normal estàndard.
Cas particular: el teorema de De Moivre-Laplace
Aquest cas particular del teorema del límit central en va ser històricament la primera atestació.
S'enuncia així:
Sigui una successió <math>(X_n)_{\,n\, \in\, \mathbb{N}^\ast}</math> de variables aleatòries de Bernoulli independents amb paràmetre (comú) p, on <math>0 < p < 1</math>. Per a tot n,
- <math>\operatorname{E}(X_n) = p\, \text{ i }\,\operatorname{Var}(X_n) = p\, (1 - p)</math> són finites.
El teorema del límit central és aplicable. Si es defineix per a tot n:
- <math>\overline{X_n} = \frac{X_1 + \cdots + X_n}{n}</math> i
- <math>\overline{X_n}\,^\ast =\frac{\overline{X_n} - \operatorname{E}\left(\overline{X_n}\right)}{\sqrt{\operatorname{Var}\left(\overline{X_n}\right)}} = \frac{\overline{X_n} - p}{\sqrt{\frac{p\, (1 - p)}{n}}} </math> (variable aleatòria estandarditzada associada a <math>\overline{X_n} </math>)
aleshores la successió <math>\Big(\overline{X_n}\,^\ast\Big)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard.
O encara, si es defineix per a tot n:
- <math>S_n = X_1 + \cdots + X_n</math> i
- <math>S_n^\ast =\frac{S_n - \operatorname{E}(S_n)}{\sqrt{\operatorname{Var}(S_n)}} = \frac{S_n - n\,p}{\sqrt{n\,p\,(1 -p)}} </math> (variable aleatòria estandarditzada associada a <math>S_n </math>)
aleshores la successió <math>(S_n^\ast)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard.
De Moivre va estudiar el cas de les variables aleatòries de Bernoulli amb paràmetre <math>p = \frac{1}{2}</math> (joc de cara o creu) i Laplace el va generalitzar ulteriorment.
Interpretació
Si n és suficientment gran, la variable aleatòria
- <math>S = X_1 + \cdots + X_n</math>
té aproximadament una distribució normal amb mitjana <math>\mu_S = n\, p</math> i variància <math>{\sigma_S}^2 = n\, p\, (1 -p)</math> .
Com que S segueix exactament la distribució binomial de paràmetres n i p, el teorema de De Moivre-Laplace es pot interpretar en termes d'aproximació de la distribució binomial <math>\mathcal{B}(n,\, p)</math> per la distribució normal <math>\mathcal{N}(n\, p,\, n\, p\, (1 - p))</math> .
Remarca:
Si n és suficientment gran, la variable aleatòria <math>\overline{X_n} </math> té aproximadament una distribució normal amb mitjana <math>\ p</math> i variància <math>\frac{p\, (1 - p)}{n}</math>.
En estadística inferencial, es pot utilitzar aquesta aproximació per construir intervals de confiança per a una proporció desconeguda p.
Aplicació: simulació de la distribució normal estàndard
Sigui una successió <math>(X_n)_{\,n\, \in\, \mathbb{N}^\ast}</math> de variables aleatòries independents i idènticament distribuïdes amb distribució uniforme contínua sobre l'interval [0, 1]. Se sap que per a tot n,
- <math>\operatorname{E}(X_n) = \frac{1}{2}\, \text{ i }\,\operatorname{Var}(X_n) = \frac{1}{12}</math> són finites.
El teorema del límit central és aplicable. Si es defineix per a tot n:
- <math>S_n = X_1 + \cdots + X_n</math> i
- <math>T_n = S_n^\ast =\frac{S_n - \operatorname{E}\left(S_n\right)}{\sqrt{\operatorname{Var}\left(S_n\right)}} = \frac{S_n - \frac{n}{2}}{\sqrt{\frac{n}{12}}} </math>,
aleshores la successió <math>(T_n)_{\,n\, \in\, \mathbb{N}^\ast}</math> convergeix en distribució cap a una variable aleatòria normal estàndard. Tenint en compte la simetria de la distribució uniforme contínua sobre l'interval [0, 1], la convergència és molt ràpida: es considera que a partir del valor n = 12, l'aproximació de la distribució de <math>T_n</math> per la distribució normal estàndard és excel·lent; en particular, es pot considerar que la distribució de
- <math>T_{12} = S_{12} - 6 = X_1 + \cdots + X_{12} - 6</math>
és pràcticament normal estàndard.
En un llenguatge de programació on existeix un generador de nombres pseudoaleatoris (sovint anomenat "random") simulant una variable aleatòria amb distribució uniforme contínua sobre l'interval [0, 1], és fàcil simular una variable aleatòria (pràcticament) normal estàndard. Heus aquí un algorisme en Pascal:
- T := - 6.0;
- for k := 1 to 12 do T : = T + random;
La variable T, que simula la variable aleatòria <math>T_{12}</math> , és (pràcticament) normal estàndard.
Contraexemple
En totes les versions del teorema del límit central, se suposa l'existència de la variància (finita) de cadascuna de les variables aleatòries de la successió.
Sigui una successió <math>(X_n)_{\,n\, \in\, \mathbb{N}^\ast}</math> de variables aleatòries independents i idènticament distribuïdes amb distribució de Cauchy simètrica <math>\mathcal{C}(0,\, \gamma)</math>; no tenen ni mitjana ni variància.
Aleshores, per a tot n, la variable aleatòria
- <math>\overline{X_n} = \frac{X_1 + \cdots + X_n}{n}</math>
segueix la mateixa distribució de Cauchy <math>\mathcal{C}(0,\, \gamma)</math> que cadascuna de les variables aleatòries <math>X_1,\, X_2, \dots </math> (és fàcil demostrar-ho mitjançant les funcions característiques): no hi ha convergència cap a una distribució normal.
Bibliografia
- De Moivre (Abraham) — The Doctrine of Chances, or a Method of Calculating the Probabilities of Events in Play. — London, 1756
- Laplace (Pierre-Simon) — Théorie analytique des probabilités. — Paris, 1812
- Feller (William) — An Introduction to Probability Theory and Its Applications. (vol. 2) — New York, 1971. John Wiley & Sons
Enllaços externs
- Animated examples of the CLT (una il·lustració gràfica de la convergència en el cas de la distribució uniforme contínua sobre l'interval [0, 1]; vegeu supra el paràgraf relatiu a un mètode de simulació de la distribució normal estàndard)
- Central Limit Theorem Java
- Central Limit Theorem interactive simulation to experiment with various parameters