Descoberta de conhecimento e Aprendizado de Máquina

cientista

Descoberta de conhecimento em bancos de dados

KDD é o processo de várias etapas, não trivial , interativo e iterativo.

  • Interativo porquê existe interações homem e máquina.
  • Iterativo porquê sofre refinamentos sucessívos.
  • Objetivo do processo do KDD é a busca pela forma da representação do conhecimento por meio da identificação de padrões (compreensíveis, válidos ao contexto, novos e úteis)

No KDD devemos manter o foco na descoberta de padrões significativos (não apenas técnico, mas também na tomada de decisão).

A busca por padrões úteis nos dados já recebeu nome de:

  • Descoberta de informação,
  • Data Mining (Mineração de Dados),
  • extração de conhecimento,
  • descoberta de informação,
  • arqueologia de dados e
  • processamento de dados

O KDD pode ser dividido em 9 etapas:

  1. Desenvolver um conhecimento prévio para identificar o objetivo do ponto de vista do cliente e compreender a sua aplicação prática no mundo real.
  2. Selecionar um conjunto de dados de onde pretendemos extrair o conhecimento
  3. Limpeza de dados, pré-processamento, remoção de ruídos. Nesta faze utilizamos o Pandas.
  4. Redução e projeção de dados. Encontrar características úteis que representa a função do objetivo da tarefa.
  5. Corrrespodência dos objetivos do processo KDD (primeiros passos), nesta etapa podemos fazer um resumo, classificação por classes, regressão, agrupamento etc.
  6. Análise exploratória e seleção de modelos e hipóteses: Decidir que modelos e parâmetros serão mais apropriados na extração dos padrões.
  7. Prospecção de dados usando aprendizado de máquina
  8. Interpretação de padrões minerados, regressando possivelmente aos passos anteriores.
  9. Atuar na fronteira do conhecimento descoberto ao utilizar diretamente o conhecimento, classificando o conhecimento em outro sistema para ação futura, ou, simplesmente, documentando e comunicando às partes interessadas. Esse processo inclui também a verificação e a resolução de conflitos potenciais com conhecimentos previamente obtidos.

Técnicas Principais:

  • Classificação, hierarquização dos dados baseada em estágios de decisão (nós) e na separação de classes e subconjuntos. (ex: árvores de decisão)
  • Clusterização, se baseia no método do vizinho mais próximo, combina e compara atributos para estabelecer hierarquia de semelhança. (ex: K-means)
  • Algorítmos genéticos, são métodos gerais de busca e otimização, inspirados na Teoria da Evolução, na qual, a cada nova geração, herda características de seus descendentes possibilitando a evolução e aprimoramento.
  • Associação, estabelece uma correlação estatística entre atributos de dados e conjunto de dados. (ex: regras “se…então”)
  • Redes Neurais Artificiais, são modelos inspirados na fisiologia do cérebro, onde o conhecimento é fruto do mapa das conexões neuronais. As conexões são fruto do somatório de pesos calculados no treinamento de máquina.
  • Detecção de anomalias

 

Pode ser Classificado:

  • Tarefas Preditivas
    • Classificação
    • Regresção
  • Tarefas Descritivas
    • Regras de Associação
    • Clustering
    • Sumarização
    • Outras

Pode usar algoritmos de Aprendizado de Máquina, mas também métodos estatísticos e de banco de dados.

O KDD envolve as disciplinas :

  • estatística,
  • banco de dados,
  • inteligência artificial e
  • aprendizado de máquina.

Aprendizado de Máquina

É uma ferramenta/disciplina que tem crescido e se desenvolvido em conjunto com o KDD possibilitando soluções tecnológicas inovadoras na busca de padrões.

Pirâmide do Conhecimento

DADO INFORMAÇÃO CONHECIMENTO SABEDORIA
Dados no Big Data Dados de Interesse Dados processados Dados formatados Dados com contexto Conhecimento

Fluxo KDD

Coleta de Dados Seleção Pré-Processamento Transformação Mineração de Dados Interpretação ou Avaliação
  • Dado bruto
  • Selecionar um sub-conjunto de dados (data set)
  • Seleçãode dados
  • Limpezade Dados
  • Integração dos Dados
  • Transformação dos Dados
  • Redução dos Dados
  • Normalização
  • Agregação
  • Criação de novos atributos
  • Redução
  • Sintetização dos dados
  • Criar modelos
  • Aplicar técnicas de Mineração de Dados
  • Descobrir novos padrões de forma autonoma
  • (Preditiva ou Descritiva)
  • avaliação estatística
  • avaliação dos profissionais de negócio

CRISP_DM

Dado Entendimento do Negócio Entendimento dos Dados Preparação de Dados Modelagem Avaliação Implantação

Início do site

Retornando ao Rio de Janeiro

Conhecimento adquirido

Quando trabalhei no comércio da minha família como gerente aprendi a tomar decisões baseadas em informações contábeis, financeiras e relatos de clientes e funcionários, aprendi a fazer meus primeiros gráficos para argumentar minhas propostas com o meu pai e tivemos muito sucesso neste comércio, mas o excell não parecia ser viável a longo prazo.
Em minha faculdade tive experiência em Delphi (cliente/servidor), base de dados e SQL, na época a web estava se iniciando.
Quando trabalhei na UFF/Centro de Niterói adquiri experiência em PL/SQL da Oracle e cheguei a comprar na época alguns livros de data warehouse mas ainda não tinha tido a oportunidade de trabalhar em um DW.

Motivação para o Site

Fui contratado como assessor técnico de gabinete no Tribunal de Contas do Estado do Acre em 2008 e meu estudo passou a ser relativo ao setor público e analisar e tramitar processos, mas após alguns anos, com o aumento de demanda de processos no meu gabinete precisei automatizar algumas coisas, o que me fez retomar os estudos em programação, primeiramente pensei em um executável instalado em meu pc.

Opitei pela linguagem Python por sua simplicidade e por ser Softwer Livre, criei executáveis que aceleraram a elaboração de Relatório Resumido da Execução Orçamentária (RREO), Relatório de Gestão Fiscal (RGF) e Aposentadorias.
Contudo estes executáveis não poderiam ser compartilhados na rede ou em pendrive por medida de segurança conforme a orientação do setor de TI.
Utilizava meu executável em meu computador com a devida autorização da TI do TCE/AC e passei a estudar programação web o que me levou ao site Área de Trampo para então poder compartilhar as ferramentas front-end com outros assessores.

No site utilizo WordPress, HTML, JavaScript, Css e JSON, algumas informações do usuário são salvas em LocalHost (cliente).
Todas as minhas ferramentas rodam como front-End, garantindo que o processamento se dá no computador do cliente, informações digitadas nestas ferramentas não navegam pela internet, dando um ótimo nível de segurança ao cliente.
Durante o processo de desenvolvimento experimentei Flask, FastHTML, React com JavaScript e com TypeScript mas me rendi a proposta do HostGator no WordPress pelo custo benefício e após conseguir adaptar a maioria das minhas ferramentas ao WordPress, aquelas que não pude adapta-las ao site mantive em executáveis python em meu pc.

Ferramentas do site

Por dois anos trabalhei no CPD do TCE/AC e aprendi expressão regular de forma autodidata para padronização de texto no Diário Eletrônico de Contas do TCE/AC, com este novo conhecimento comecei a desenvolver o Editor de Texto e o Relatório Dinâmico.

  • O Editor de Texto me permitiu extrair texto de imagens e padronizar textos com a expressão regular.
  • O Relatório Dinâmico foi inspirado em “Partes Rápidas” do Word (Office), mas nesta ferramenta você cria e nomeia seus campos podendo inclusive organiza-los em grupos e salvar o seu relatório localmente como JSON, possibilitando compartilhamento com a equipe de trabalho.

Ferramentas complementares:

  • No Kanban você pode criar as colunas que deseja
  • O Caderno de anotações para lembrarmos onde paramos
  • O Mapa Mental para organizarmos informações de forma hierarquica
  • A Engenharia de Prompt para fazer comandos mais inteligentes e extruturados a uma IA.
  • JSTest criei baseado no PyTest, esta ferramenta valida respostas de uma função javascrip

Adicionei ao site links que me ajudaram:

  • Em Online você encontra pagina para criar fórmulas, expressão regular, python, prolog, uml e diagramas
  • Em Informação você encontra ainda os Link’s recomendados
  • Em Conversões você encontra ylovepdf

Reorganizando as postagens

Em Menu > Roteiro de Estudo criei roteiros com indice hierarquico.

Divulgando a minha analise de dados

No meu tempo livre me dediquei a fazer todos os cursos de informática que queria de forma online, o que se acentuou na época da pandemia de COVID.
Rapidamente tive nescessidade de escrever postagens sobre o que estava estudando, o meu interesse de estudo me levou a mineração de dados, analise de dados com pandas, cientista de dados e Big Data.
Analisei dados reais e apresentei em gráficos dinâmicos (JavaScript e JSON) em Menu > Analise de Dados.

Ajuste ao plano do Hostgator

Cogitei fazer um site robusto em React mas o plano do Hostgator se mostrou ser o mais viável a longo prazo e optei me adequar ao WordPress.
Mesmo no WordPress ainda crio objetos JavaScript públicos para reuso em postagens e mantenho o meu CSS personalizado.
Tenho conciência que fiz um caminho longo mas aprendi muito nestes experimentos.