7.1 Modos de convergência

Sejam XX e (Xn)n∈ℕ(X_{n})_{n\in\mathbb{N}} variáveis aleatórias definidas num mesmo espaço de probabilidade (Ω,ℱ,ℙ)(\Omega,\mathcal{F},\mathbb{P}).

Definição 7.1 (Convergência em probabilidade).

Dizemos que a sequência (Xn)n(X_{n})_{n} converge em probabilidade para XX, denotado por Xn⁢→ℙ⁢XX_{n}\overset{\mathbb{P}}{\rightarrow}X, se, para todo ε>0\varepsilon>0, vale

ℙ⁢({ω∈Ω:|Xn⁢(ω)−X⁢(ω)|⩾ε})→0⁢ quando ⁢n→∞.\mathbb{P}\big{(}\{\omega\in\Omega:\left|X_{n}(\omega)-X(\omega)\right|% \geqslant\varepsilon\}\big{)}\to 0\text{ quando }n\to\infty.
Exemplo 7.2.

Sejam X1,X2,…X_{1},X_{2},\dots variáveis aleatórias independentes, tais que Xn∼Bernoulli(1n)X_{n}\sim\mathop{\mathrm{Bernoulli}}\nolimits(\frac{1}{n}). Para ε<1\varepsilon<1, temos que

ℙ⁢(|Xn−0|⩾ε)=ℙ⁢(Xn=1)=1n→0\mathbb{P}\big{(}\left|X_{n}-0\right|\geqslant\varepsilon\big{)}=\mathbb{P}(X_% {n}=1)=\tfrac{1}{n}\to 0

e, portanto, Xn⁢→ℙ⁢0X_{n}\overset{\mathbb{P}}{\rightarrow}0. ∎

Exemplo 7.3.

Sejam X2,X3,X4,…X_{2},X_{3},X_{4},\dots variáveis aleatórias independentes, identicamente distribuídas com distribuição Exp(1)\mathop{\mathrm{Exp}}\nolimits(1) e tome

Yn=Xnlog⁡n.Y_{n}=\frac{X_{n}}{\log n}.

Então,

ℙ⁢(|Xnlog⁡n−0|⩾ε)=ℙ⁢(Xn⩾ε⁢log⁡n)=n−ε→0\textstyle\mathbb{P}\left(\big{|}\frac{X_{n}}{\log n}-0\big{|}\geqslant% \varepsilon\right)=\mathbb{P}(X_{n}\geqslant\varepsilon\log n)=n^{-\varepsilon% }\to 0

para todo ε>0\varepsilon>0 e, portanto, Xnlog⁡n⁢→ℙ⁢0\frac{X_{n}}{\log n}\overset{\mathbb{P}}{\rightarrow}0. ∎

Exemplo 7.4 (Onda dançante).

Sejam U∼𝒰(0,1]U\sim\mathcal{U}(0,1] e (In,k)n,k(I_{n,k})_{n,k} a sequência de intervalos dada por In,k=(k2n,k+12n],n∈ℕ,k=0,…⁢,2n−1I_{n,k}=(\frac{k}{2^{n}},\frac{k+1}{2^{n}}],\ n\in\mathbb{N},\ k=0,\dots,2^{n}-1. Definimos as variáveis aleatórias Xn,k=𝟙In,k⁢(U)X_{n,k}={\mathds{1}}_{I_{n,k}}(U), que assemelham-se a uma onda dançante (veja Figura 7.1).

Primeiros elementos do contra-exemplo da “onda dançante”.
Figura 7.1: Primeiros elementos do contra-exemplo da “onda dançante”.

À medida que nn cresce, os intervalos In,kI_{n,k} vão se tornando mais estreitos, de modo que dado qualquer 0<ε<10<\varepsilon<1,

ℙ⁢(|Xn,k|⩾ε)=ℙ⁢(U∈In,k)=2−n→0⁢ quando ⁢n→∞.\mathbb{P}(|X_{n,k}|\geqslant\varepsilon)=\mathbb{P}\big{(}U\in I_{n,k}\big{)}% =2^{-n}\to 0\text{ quando }n\to\infty.

Podemos ordenar os pares da forma (n,k)(n,k) sequencialmente da seguinte maneira. Para todo j∈ℕj\in\mathbb{N}, existe um único par (n⁢(j),k⁢(j))(n(j),k(j)) tal que j=2n−1+kj=2^{n-1}+k. Tomamos Yj=Xn⁢(j),k⁢(j)Y_{j}=X_{n(j),k(j)}. Assim, Yj⁢→ℙ⁢0Y_{j}\overset{\mathbb{P}}{\rightarrow}0 quando j→∞j\to\infty. ∎

No exemplo acima, para todo ω∈Ω\omega\in\Omega fixado, U⁢(ω)∈In,kU(\omega)\in I_{n,k} para infinitos valores de índices (n,k)(n,k). Com efeito, para cada n∈ℕn\in\mathbb{N} existirá um único valor de k∈{0,…⁢,2n−1}k\in\{0,\dots,2^{n}-1\} tal que U⁢(ω)∈In,kU(\omega)\in I_{n,k}. Ou seja, {ω∈Ω:Yj⁢(ω)→0}=∅︀\big{\{}\omega\in\Omega:Y_{j}(\omega)\to 0\big{\}}=\emptyset apesar de que Yj⁢→ℙ⁢0Y_{j}\overset{\mathbb{P}}{\rightarrow}0. Isto é, a convergência em probabilidade tem suas debilidades, o que nos motiva a fazer a próxima definição.

Definição 7.5 (Convergência quase certa).

Dizemos que XnX_{n} converge quase certamente para XX, denotado por Xn⁢→q.c.⁢XX_{n}\overset{\mathrm{q.c.}}{\rightarrow}X, se

ℙ⁢({ω∈Ω:Xn⁢(ω)→X⁢(ω)⁢ quando ⁢n→∞})=1.\mathbb{P}\left(\big{\{}\omega\in\Omega:X_{n}(\omega)\to X(\omega)\text{ % quando }n\to\infty\}\right)=1.

A convergência quase certa é uma convergência pontual num conjunto de probabilidade 11, ou seja, Xn⁢(ω)→X⁢(ω)X_{n}(\omega)\to X(\omega) para todo ω\omega, exceto em um conjunto de probabilidade nula. Por outro lado, convergência em probabilidade não diz respeito à convergência pontual. Ela apenas afirma que, para valores grandes de nn, as variáveis XnX_{n} e XX são aproximadamente iguais com probabilidade muito alta, conforme ilustrado no Exemplo 7.4.

Exemplo 7.6.

Sejam U∼𝒰⁢[0,1]U\sim\mathcal{U}[0,1] e (Xn)n(X_{n})_{n} a sequência de variáveis aleatórias dada por Xn=U+UnX_{n}=U+U^{n}. Afirmamos que Xn⁢→q.c.⁢UX_{n}\overset{\mathrm{q.c.}}{\rightarrow}U. Com efeito,

ℙ(Xn→U)=ℙ(Un→0)=ℙ(U∈[0,1))=1\mathbb{P}(X_{n}\to U)=\mathbb{P}(U^{n}\to 0)=\mathbb{P}\left(U\in[0,1)\right)=1

e, portanto, Xn⁢→q.c.⁢UX_{n}\overset{\mathrm{q.c.}}{\rightarrow}U. ∎

Definição 7.7 (Convergência em ℒp\mathcal{L}^{p}).

Dado p⩾1p\geqslant 1, dizemos que XnX_{n} converge para XX em ℒp\mathcal{L}^{p}, que denotamos por Xn⁢→ℒp⁢XX_{n}\overset{\mathcal{L}^{p}}{\rightarrow}X, se 𝔼⁢|Xn|p<∞\mathbb{E}|X_{n}|^{p}<\infty para todo nn e

limn→∞𝔼⁢|Xn−X|p=0.\lim_{n\to\infty}\mathbb{E}|X_{n}-X|^{p}=0.
Exemplo 7.8 (Da volta à onda dançante).

Seja (Xn,k)(X_{n,k}) a onda dançante definida no Exemplo 7.4, definimos a “onda dançante crescente” (X~n,k)(\tilde{X}_{n,k}), onde X~n,k=2n/2⁢Xn,k\tilde{X}_{n,k}=2^{n/2}X_{n,k}, e definimos (Y~j)j(\tilde{Y}_{j})_{j} como a correspondente sequência, segundo o mesmo ordenamento feito no Exemplo 7.4. Podemos observar que no caso p=1p=1, vale

𝔼⁢|X~n,k|=2−n/2→0⁢quando⁢n→∞,\mathbb{E}|\tilde{X}_{n,k}|=2^{-n/2}\to 0\ \text{quando}\ n\to\infty,

logo Y~j⁢→ℒ1⁢0\tilde{Y}_{j}\overset{\mathcal{L}^{1}}{\rightarrow}0 quando j→∞j\to\infty. Por outro lado, no caso p=2p=2, vale

𝔼⁢|X~n,k|2=1↛0,\mathbb{E}|\tilde{X}_{n,k}|^{2}=1\not\to 0,

portanto, (Y~j)j(\tilde{Y}_{j})_{j} não converge para 0 em ℒ2\mathcal{L}^{2} quando j→∞j\to\infty. ∎

Proposição 7.9.

Se Xn⁢→ℒp⁢XX_{n}\overset{\mathcal{L}^{p}}{\rightarrow}X para algum p⩾1p\geqslant 1, então 𝔼⁢Xn→𝔼⁢X\mathbb{E}X_{n}\to\mathbb{E}X.

Demonstração.

Pela Desigualdade de Lyapunov,

|𝔼⁢Xn−𝔼⁢X|⩽𝔼⁢|Xn−X|⩽(𝔼⁢|Xn−X|p)1p→0.∎\big{|}\mathbb{E}X_{n}-\mathbb{E}X\big{|}\leqslant\mathbb{E}|X_{n}-X|\leqslant% \left(\mathbb{E}|X_{n}-X|^{p}\right)^{\frac{1}{p}}\to 0.\qed
Definição 7.10 (Convergência em distribuição).

Sejam (Xn)n(X_{n})_{n} e XX variáveis aleatórias, (FXn)n⩾1(F_{X_{n}})_{n\geqslant 1} e FXF_{X} suas respectivas funções de distribuição. Dizemos que (Xn)n⩾1(X_{n})_{n\geqslant 1} converge para XX em distribuição, denotado por Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X, se

limn→∞FXn⁢(x)=FX⁢(x),\lim_{n\to\infty}F_{X_{n}}(x)=F_{X}(x),

para todo x∈ℝx\in\mathbb{R} ponto de continuidade da função FXF_{X}.

Exemplo 7.11.

Seja (Xn)n(X_{n})_{n} uma sequência de variáveis aleatórias com Xn∼Geom(pn)X_{n}\sim\mathop{\mathrm{Geom}}\nolimits(p_{n}), neste caso

FXn⁢(x)={0, se ⁢x<0,1−(1−pn)⌊x⌋, se ⁢x⩾0.F_{X_{n}}(x)=\begin{cases}0,\ &\text{ se }x<0,\\ 1-(1-p_{n})^{\lfloor x\rfloor},\ &\text{ se }x\geqslant 0.\end{cases}

Além disso, assuma que n⁢pn→λ>0np_{n}\to\lambda>0, quando n→∞n\to\infty. Mostraremos que a sequência (Xnn)n(\frac{X_{n}}{n})_{n} converge em distribuição para uma distribuição exponencial de parâmetro λ\lambda. Para todos x∈[0,∞)x\in[0,\infty) e n⩾1n\geqslant 1, podemos escrever

FXnn⁢(x)\displaystyle F_{\frac{X_{n}}{n}}(x) =ℙ⁢(Xn⩽n⁢x)=ℙ⁢(Xn⩽⌊n⁢x⌋)\displaystyle=\mathbb{P}(X_{n}\leqslant nx)=\mathbb{P}(X_{n}\leqslant\lfloor{% nx}\rfloor)
=1−(1−pn)⌊n⁢x⌋=1−(1−n⁢pnn)n⁢x⁢(1−n⁢pnn)⌊n⁢x⌋−n⁢x.\displaystyle=1-(1-p_{n})^{\lfloor{nx}\rfloor}=1-(1-\frac{np_{n}}{n})^{nx}(1-% \frac{np_{n}}{n})^{\lfloor{nx}\rfloor-nx}.

Agora, observando que

(1−n⁢pnn)n⁢x→e−λ⁢xe(1−n⁢pnn)⌊n⁢x⌋−n⁢x→1,(1-\frac{np_{n}}{n})^{nx}\to e^{-\lambda x}\quad\text{e}\quad(1-\frac{np_{n}}{% n})^{\lfloor{nx}\rfloor-nx}\to 1,

obtemos que FXnn⁢(x)→1−eλ⁢xF_{\frac{X_{n}}{n}}(x)\to 1-e^{\lambda x} quando n→∞n\to\infty para todo x⩾0x\geqslant 0. Como já sabemos, essa expressão é a da função de distribuição de uma variável exponencial de parâmetro λ\lambda. ∎

Exemplo 7.12.

Seja Xn=1nX_{n}=\frac{1}{n} para n⩾1n\geqslant 1 e X=0X=0. Então, Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X, embora limn→∞Fn⁢(0)=0≠1=F⁢(0)\lim_{n\to\infty}F_{n}(0)=0\neq 1=F(0). Mas como 0 não é ponto de continuidade de FF, isto não é problema. ∎

No exemplo acima, temos variáveis aleatórias degeneradas que assumem os valores 1n\frac{1}{n} e 0. Qualquer critério de convergência minimamente razoável deveria incluir esse caso. Por isso, não poderíamos pedir que FXn⁢(x)→FX⁢(x)F_{X_{n}}(x)\to F_{X}(x) nos pontos de descontinuidade de FXF_{X}.

Gostaríamos de ressaltar que, na convergência em distribuição, não é necessário que as variáveis aleatórias (Xn)n(X_{n})_{n} e XX estejam definidas no mesmo espaço de probabilidade, pois essa noção de convergência leva em conta apenas as suas respectivas funções de distribuição.

Vejamos agora um critério para a convergência em distribuição de variáveis aleatórias assumindo valores em ℕ0\mathbb{N}_{0}.

Proposição 7.13.

Sejam (Xn)n(X_{n})_{n} e XX variáveis aleatórias tomando valores em ℕ0\mathbb{N}_{0}. Então, Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X se, e somente se, pXn⁢(k)→pX⁢(k)p_{X_{n}}(k)\to p_{X}(k) para todo k∈ℕ0k\in\mathbb{N}_{0}.

Demonstração.

Observemos que FXn⁢(x)=∑k=0⌊x⌋pXn⁢(k)F_{X_{n}}(x)=\sum_{k=0}^{\lfloor x\rfloor}p_{X_{n}}(k) e FX⁢(x)=∑k=0⌊x⌋pX⁢(k)F_{X}(x)=\sum_{k=0}^{\lfloor x\rfloor}p_{X}(k) para todo x∈ℝx\in\mathbb{R}. Supondo que pXn⁢(k)→pX⁢(k)p_{X_{n}}(k)\to p_{X}(k) para todo k∈ℕ0k\in\mathbb{N}_{0}, isso nos dá Fn⁢(x)→F⁢(x)F_{n}(x)\to F(x) para todo x∈ℝx\in\mathbb{R} e, portanto, Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X.

Reciprocamente, suponha que Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X e seja k∈ℕ0k\in\mathbb{N}_{0}. Como k±12k\pm\tfrac{1}{2} são pontos de continuidade de FXF_{X},

pXn⁢(k)=FXn⁢(k+12)−FXn⁢(k−12)→FX⁢(k+12)−FX⁢(k−12)=pX⁢(k)p_{X_{n}}(k)=F_{X_{n}}(k+\tfrac{1}{2})-F_{X_{n}}(k-\tfrac{1}{2})\to F_{X}(k+% \tfrac{1}{2})-F_{X}(k-\tfrac{1}{2})=p_{X}(k)

quando n→∞n\to\infty, concluindo a prova. ∎

Exemplo 7.14.

Sejam (Xn)n(X_{n})_{n} e XX variáveis aleatórias com X∼Poisson(λ)X\sim\mathop{\mathrm{Poisson}}\nolimits(\lambda) e Xn∼Binom(n,λn)X_{n}\sim\mathop{\mathrm{Binom}}\nolimits(n,\frac{\lambda}{n}). Conforme vimos na Seção 3.2, pXn⁢(k)→pX⁢(k)p_{X_{n}}(k)\to p_{X}(k) para todo k∈ℕ0k\in\mathbb{N}_{0}. Logo, pela Proposição 7.13, Xn⁢→d⁢XX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}X. ∎

Finalizamos esta seção discutindo a unicidade dos limites de sequências de variáveis aleatórias. Se Xn⁢→d⁢YX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}Y e Xn⁢→d⁢ZX_{n}\overset{\smash{\mathrm{d}}}{\rightarrow}Z, então Y∼ZY\sim Z, veremos a prova na Seção 7.4. Se Xn→YX_{n}\to Y e Xn→ZX_{n}\to Z quase certamente, em probabilidade ou em ℒp\mathcal{L}^{p}, então Y=ZY=Z quase certamente, deixamos a prova como exercício.