IA376M/EA099M - Tópicos em Engenharia de Computação VII

Tópico: Análise Visual em Ciência de Dados (Visual Analytics)

Primeiro Semestre de 2026

Profa. Wu, Shin - Ting

DCA/ FEEC/ UNICAMP

https://dca.fee.unicamp.br/cursos/IA376M/1s2026/

[Objetivo] [Horário] [Tópicos] [Material de Apoio] [Dinâmica das Aulas] [Projetos] [Calendário de atividades] [Critério de Avaliação] [Resultados dos Projetos]

Objetivo

Este tópico tem como objetivo fornecer uma introdução à Análise Visual de Dados, uma área emergente que se destaca pela integração do processamento numérico das máquinas com a capacidade cognitiva dos especialistas humanos na resolução de problemas complexos. Com uma abordagem prática e fundamentada em teoria, todos os conceitos são colocados em prática por meio de atividades utilizando R ou Python.

Local e Período Letivo


Tópicos


Material de Apoio

Textos de Apoio

  1. Notas de aula
  2. Data Wrangling and Visualization with R e Statistics and Prediction Algorithms Through Case Studies
    Autor: Rafael A. Irizarry
    Plataforma de publicação de livros: Leanpub
    Parte da primeira edição traduzida para português por Benilton S Carvalho, Diego Mariano, Guilherme Ludwig, Larissa Ávila, Pedro Baldoni, Samara F Kiihl e Tatiana Benaglia
  3. Statistical Inference via Data Science - A ModernDive into R and the Tidyverse
    Autores: Chester Ismay e Albert Y. Kim
  4. R for Data Science (2e)
    Autores: Hadley Wickham, Mine Çetinkaya-Rundel e Garrett Grolemund
    Segunda Edição, 2023
    ISBN: 9781492097402
  5. Python for Data Analysis (3e)
    Autor: Wes McKinney
    Terceira Edição, 2022
    ISBN: 978-1098104030
  6. Py for Data Science
    (Versão da primeira edição de R for Data Science em Python)
    Autores: J. Hathaway e Katie Larson

Dados

  1. Kaggle.
  2. Repositório RDatasets: uma coleção com um grande número de conjuntos de dados, originalmente distribuídos juntamente com o R e seus pacotes. Esses conjuntos de dados são amplamente usados como exemplos em diversos livros e materiais didáticos sobre a linguagem R e análise de dados.
  3. Conjuntos de dados usados em Ismay.
  4. Portal Brasileiro de Dados Abertos e Catálogo Nacional de Dados.
  5. Dados geoespaciais abertos do Brasil organizados elaborado pelo IPEA (Instituto de Pesquisa Econômica Aplicada).
  6. Portal de Dados Abertos do TSE.
  7. The Home of the U.S. Government's Open Data.
  8. European data.
  9. World Bank Open Data.
  10. UNdata: A world of information.
  11. WHO: The Global Health Observatory.
  12. Climate Trace.

Ecossistemas para Análise de Dados

Embora R seja a ferramenta usada em muitos exemplos dos textos de apoio recomendados, a preferência para análise de dados é por Python devido à sua versatilidade, crescente popularidade e suporte superior para tecnologias de Deep Learning (Aprendizado de Máquina do estado-da-arte). Por padrão, utilizaremos como ecossistemas para análise de dados o Jupyter Notebook ou o Google Colab. Em casos excepcionais, o ecossistema RStudio pode ser usado para análise de dados.


Dinâmica das Aulas

O curso é estruturado em quatro blocos fundamentais: aquisição de dados; exploração visual (EDA) para formulação de hipóteses; validação estatística; e modelagem explicativa/preditiva. As aulas adotam uma dinâmica prática e direta: iniciamos com uma síntese dos conceitos-chave das notas de aula, focando na aplicação estratégica dos recursos computacionais. O cerne das atividades será o desenvolvimento de projetos baseados em problemas reais, onde o tempo em sala é priorizado para a evolução desses projetos, para rodadas de discussão coletiva sobre os desafios encontrados e para breves apresentações de resultados (pitch).

É fundamental que os alunos tragam seus laptops e utilizem os ecossistemas sugeridos (Jupyter, Google Colab ou RStudio) como ambiente único de desenvolvimento e documentação. Mais do que resolver exercícios isolados, o objetivo é que cada estudante saiba navegar pelo ciclo completo da Ciência de Dados, transformando dados brutos em interfaces interativas e decisões justificadas.


Resultados dos Projetos

IA376

Os cinco projetos desenvolvidos ao longo da disciplina demonstram, na prática, que a qualidade de um modelo de aprendizado de máquina depende, antes de tudo, da qualidade da compreensão dos dados. Em cada estudo, a exploração visual foi integrada aos fundamentos da Estatística Descritiva e da Inferência Estatística, permitindo identificar padrões, validar hipóteses, comunicar os achados, certificar relevância das variáveis e compreender as incertezas envolvidas antes da etapa de treinamento dos modelos. Essa abordagem incentiva o desenvolvimento de soluções mais robustas, interpretáveis e cientificamente fundamentadas.

Os projetos abordam desafios contemporâneos em diferentes áreas do conhecimento, evidenciando a versatilidade das técnicas estudadas. Entre os temas explorados estão:

Essa diversidade permite aos estudantes aplicar metodologias comuns de análise de dados em problemas reais de engenharia, energia, esportes e inteligência artificial.

Mais do que produzir modelos preditivos, os projetos enfatizam uma prática essencial da Ciência de Dados moderna: explorar, compreender e validar estatisticamente os dados antes do treinamento de algoritmos de aprendizado de máquina. O uso sistemático de visualizações, testes de hipóteses, análise de correlações, avaliação de distribuições, intervalos de confiança e validação de modelos demonstra que decisões fundamentadas em evidências estatísticas resultam em modelos mais confiáveis, transparentes e capazes de generalizar para novos cenários.

Ao longo da disciplina, foram desenvolvidas competências que vão além da utilização de bibliotecas e algoritmos prontos. Os estudantes aprendem a interpretar criticamente os dados, justificar escolhas metodológicas e construir modelos baseados em evidências quantitativas, consolidando uma formação que integra Análise Visual, Estatística e Aprendizado de Máquina em um fluxo completo de Ciência de Dados. Esses projetos representam exemplos concretos dessa integração e ilustram como fundamentos estatísticos constituem um elemento indispensável para o desenvolvimento de soluções inteligentes, confiáveis e alinhadas às demandas atuais da pesquisa e da indústria.


Avaliações

A avaliação é dividida em duas partes: 4 subprojetos (P1, P2, P3 e P4) e 1 Projeto Final (PF). A avaliação de cada subprojeto Pi é composta por 3 partes:

Pi = 0.4 Ri + 0.3 Pi + 0.3 Di, onde:

E a avaliação do PF, em grupo de até 2 pessoas, é composta por duas partes:

PF = 0.5 A + 0.5 E, onde:

Serão aprovados os alunos que satisfizerem as seguintes condições:

O conceito final dos alunos será determinado conforme a seguinte escala: A para notas no intervalo de 10.0 a 8.5, B para notas entre 8.4 e 7.0, C para notas entre 6.9 e 5.0, e D para notas abaixo de 5.0.


Sáb 21 fev 2026 08:47:09 -03


"Esta página, assim como todas as páginas sob esta mesma árvore, não é uma publicação oficial da UNICAMP, seu conteúdo não foi examinado e/ou editado por esta instituição. A responsabilidade por seu conteúdo é exclusivamente do autor."

"This page, as well as all pages under this same tree, is not an official publication from UNICAMP; its content has not been verified and/or edited by this institution. The author is solely responsible by its contents."