Redes Bayesianas com Variaveis Continuas

Professora

O que são redes bayesianas com variáveis contínuas?

Redes bayesianas com variáveis contínuas modelam relações probabilísticas entre variáveis numéricas reais. Cada nó representa uma variável que pode assumir qualquer valor em um intervalo. Diferentemente das discretas, as distribuições condicionais são funções densidade de probabilidade (PDFs). A forma mais comum é a distribuição normal (gaussiana) para cada nó. Nesse caso, a rede é chamada de rede bayesiana gaussiana (GBN). Cada nó tem uma média que é combinação linear dos pais e uma variância fixa. A distribuição conjunta é uma normal multivariada com estrutura de covariância esparsa. Isso permite inferência eficiente por álgebra linear, sem enumeração de casos. Portanto, redes contínuas são ideais para problemas de engenharia e finanças.

Características fundamentais

Essas redes possuem três características principais que as distinguem. Primeiro, as CPTs são substituídas por equações lineares com coeficientes de regressão. Segundo, a inferência exata é feita por eliminação gaussiana, que é polinomial. Terceiro, a aprendizagem de parâmetros usa estimativa de máxima verossimilhança ou bayesiana. A estrutura pode ser aprendida com algoritmos de busca usando critérios como BIC. Além disso, redes contínuas suportam variáveis latentes (não observadas) com integração analítica. A suposição de normalidade é forte, mas muitas vezes razoável na prática. Transformações como log ou Box-Cox podem tornar os dados mais gaussianos.

Vantagens e aplicações típicas

A principal vantagem é a eficiência computacional para redes de grande porte. Elas são usadas em controle de processos, previsão de séries temporais e genética. Também são aplicadas em sistemas de recomendação baseados em notas contínuas. Outra vantagem é a facilidade de incorporar relações lineares entre variáveis. Contudo, a linearidade pode ser uma limitação para fenômenos não-lineares. Para esses casos, usa-se redes com misturas de gaussianas ou modelos não-paramétricos.

Redes bayesianas contínuas são amplamente usadas em modelos de equações estruturais. Elas permitem testar hipóteses causais com dados observacionais. A inferência por eliminação de variáveis contínuas usa operações de marginalização gaussiana. Isso é equivalente a calcular distribuições condicionais em normais multivariadas. Uma propriedade importante é que a distribuição conjunta é completamente especificada pela média e precisão. A precisão é a inversa da matriz de covariância, que é esparsa (estrutura da rede). Essa esparsidade reduz custo computacional de O(n³) para O(n * grau²). Aprendizado de estrutura em redes contínuas usa testes de correlação parcial. Testes de independência condicional verificam se a correlação entre duas variáveis é zero dado os pais. Algoritmos como PC (Peter-Clark) constroem o grafo a partir desses testes. Redes contínuas também podem ser dinâmicas (DBNs contínuas) para séries temporais. Nesse caso, usa-se modelos autorregressivos vetoriais com estrutura esparsa. Elas são usadas em economia para prever taxas de juros e inflação. Assim, redes contínuas são uma ferramenta poderosa para dados numéricos.

Um exemplo clássico é a rede que relaciona temperatura (T), pressão (P) e volume (V) de um gás. T e P influenciam V, mas T e P são independentes a priori. A relação é aproximadamente linear (lei dos gases ideais) com ruído gaussiano. A rede permite inferir P dado T e V observados, ou V dado T e P.


Enunciado do exemplo clássico

Implemente uma rede bayesiana gaussiana para o sistema: Variáveis: Temperatura (T ~ N(20, 4)), Pressão (P ~ N(101, 9)), e Volume (V = 0.5*T – 0.3*P + erro, erro ~ N(0, 1)). As relações são: T e P são independentes; V depende de T e P linearmente. Construa a matriz de covariância conjunta e calcule P(V | T=25) e P(P | V=10, T=22). Plote a estrutura da rede e as distribuições condicionais resultantes.

Este código implementa uma rede gaussiana com inferência analítica. A estrutura do grafo mostra a dependência de V em T e P. As curvas de densidade mostram as distribuições condicionais solicitadas. A inferência é exata e eficiente, usando apenas álgebra linear. Para iniciantes, este exemplo conecta redes bayesianas a dados contínuos. Redes contínuas são, portanto, uma extensão natural e poderosa.

Redes Bayesianas com Variaveis Discretas

Professora

O que são redes bayesianas com variáveis discretas?

Redes bayesianas com variáveis discretas são modelos probabilísticos onde cada nó assume valores categóricos finitos. Esses valores podem ser binários (sim/não), ordinais (baixo/médio/alto) ou nominais (cor/forma). Cada nó possui uma tabela de probabilidade condicional (CPT) que lista todas as combinações possíveis. Por exemplo, um nó com 3 pais binários terá 2³ = 8 entradas na sua CPT. A distribuição conjunta é o produto de todas as CPTs, como nas redes contínuas. Contudo, o raciocínio é feito por contagem e soma, não por integrais. Isso torna a inferência exata viável para redes de tamanho moderado. Variáveis discretas são naturais em diagnósticos, classificação e sistemas especialistas. Elas também são mais fáceis de interpretar por seres humanos não-técnicos.

Características fundamentais

Essas redes possuem três características marcantes que as distinguem. Primeiro, as CPTs são matrizes de probabilidade que somam 1 para cada linha. Segundo, a independência condicional é testada por testes qui-quadrado ou mutual information. Terceiro, a inferência pode ser feita por eliminação de variáveis, que é exata. A aprendizagem de parâmetros é feita por máxima verossimilhança (contagens) ou suavização de Laplace. A suavização evita probabilidades zero para combinações não observadas nos dados. Além disso, a estrutura pode ser aprendida por busca gulosa usando BIC ou AIC. Redes discretas são amplamente suportadas por bibliotecas como pgmpy e bnlearn.

Vantagens e aplicações típicas

A principal vantagem é a simplicidade computacional e interpretabilidade. Elas são usadas em sistemas de suporte à decisão médica (ex.: diagnóstico de gripe x covid). Também são aplicadas em filtros de spam, sistemas de recomendação e mineração de dados. Outra vantagem é a facilidade de incorporar conhecimento de especialistas via CPTs. Contudo, o número de parâmetros cresce exponencialmente com o número de pais. Para lidar com isso, usa-se estruturas esparsas ou árvores de decisão nas CPTs.

O tratamento de variáveis discretas é mais antigo e consolidado na literatura. Modelos como o classificador Naive Bayes são um caso especial com um único nó pai. Redes mais complexas podem ter múltiplas camadas de dependência entre variáveis. A inferência por eliminação de variáveis elimina nós não observados por soma. Isso reduz o problema a consultas condicionais simples de ser calculadas. Para redes grandes (dezenas de nós), usa-se amostragem de Gibbs ou MCMC. A amostragem gera aproximações, mas é escalável e fácil de implementar. A suavização de Laplace adiciona pseudocontagens para evitar overfitting. Isso é especialmente importante quando os dados são escassos. Redes bayesianas discretas também podem modelar séries temporais com cadeias de Markov. Nesse caso, cada nó tem arestas do tempo t-1 para t. Elas são usadas em previsão de demanda e análise de séries climáticas. A estrutura pode ser visualizada como um diagrama de influência. Assim, redes discretas são uma ferramenta madura e amplamente aplicada.

Um exemplo clássico é o problema do “Carro Não Liga” com variáveis: Bateria (B), Gasolina (G), Partida (P), e Motor (M). Todas são binárias (boa/ruim, cheia/vazia, etc.). A rede calcula a probabilidade de cada causa dado que o motor não liga. Isso auxilia o mecânico a diagnosticar a falha de forma estruturada.


Enunciado do exemplo clássico

Implemente uma rede bayesiana discreta para o diagnóstico de um motor de carro. Variáveis: Bateria (B: 0=ruim, 1=boa), Gasolina (G: 0=vazia, 1=cheia), Partida (P: 0=não funciona, 1=funciona), Motor (M: 0=não liga, 1=liga). Relações: B e G influenciam P; P influencia M. Defina CPTs manualmente com valores razoáveis. Calcule P(B=0 | M=0) e P(G=0 | M=0) usando inferência exata. Plote a rede graficamente e uma barra com as probabilidades posteriores.

Este código implementa uma rede discreta com inferência por enumeração. A estrutura do grafo mostra a relação causal entre bateria, gasolina, partida e motor. As barras de probabilidade revelam que a bateria ruim é a causa mais provável. A gasolina vazia tem uma probabilidade menor, mas ainda significativa. Para iniciantes, este exemplo demonstra o poder diagnóstico das redes discretas. Elas são, portanto, ferramentas essenciais para sistemas baseados em regras.