O Spark representa outro framework para processamento de dados em larga escala, que foi motivado, por exemplo, pelo aumento dos datasets na web e pela Internet das Coisas (IoT). O Apache Spark, uma alternativa ao MapReduce para algumas aplicações, é um sistema de computação em cluster com baixa latência e usado para grandes conjuntos de dados.Assinale a alternativa que descreve um dos principais benefícios do Apache Spark.
O Hadoop é uma plataforma de software desenvolvida em Java utilizada para clusters e processamento de grandes volumes de dados. São camadas importantes de uma aplicação no contexto do Hadoop:I. Armazenamento.
II. Processamento.
III. Interface.
IV. Conexão.
O conjunto de soluções do framework Apache Spark é denominado "ecossistema Apache Spark". Esse ecossistema é constituído pelos seguintes elementos: Spark Core, Spark SQL, Spark Streaming, MLLib e GraphX, cada qual com as suas funções específicas no framework.Com relação às funcionalidades dos elementos que compõem o ecossistema do framework Apache Spark, avalie as afirmações a seguir que explicam essas vantagens.I. Spark Core: refere-se ao motor de execução da plataforma e representa um mecanismo de processamento de dados distribuído.
II. Spark SQL: é um mecanismo para o Hadoop Hive que permite que consultas não modificadas sejam executadas de forma mais rápida.
III. Spark Streaming: é um mecanismo que permite aplicativos interativos e analíticos poderosos no streaming de dados.
IV. GraphX: é o mais novo componente do Spark e representa uma biblioteca de aprendizado de máquina escalável.
V. MLLib: é um mecanismo de computação gráfica que fornece vários utilitários úteis para tarefas de aprendizado de máquina.É correto o que se afirma em:
A computação em grade (Grid Computing) caracteriza-se pela coleção de recursos computacionais de comunicação utilizado para a execução de aplicações. São características de uma Grade (Grid):I. Visão uniforme de recursos computacionais.
II. O nómestre não é um elemento de um grid.
III. O usuário vê um grid como várias entidades.
IV. Ser fundamentado em protocolos da Internet/Web e tecnologias de Web Services.
A Grade (Grid) é uma plataforma para execução de aplicações paralelas amplamente distribuída, heterogênea e compartilhada. Outras importantes características da grade incluem:
Acerca dos tipos de cluster no contexto de computação escalável é correto afirmar que: I. O cluster de balanceamento de carga depende de 1 ou mais nós balanceadores de carga que será enviada aos servidores que de fato vão processar a carga. II. O cluster de alta disponibilidade é aquele que tende a se manter resistente a falhas e quando esta ocorre o usuário não percebe. III. O cluster de alta disponibilidade tem a mesma função que um cluster de alto desempenho. IV. Cluster de alta disponibilidade é aquele usado para distribuir a carga de trabalho.
Cloud computing, ou computação em nuvem, é uma tecnologia em que os servidores são desenvolvidos para armazenar e gerir dados, executar aplicações ou fornecer conteúdos ou um serviço, como transmissão em fluxo de vídeos, webmail, software de produtividade para escritórios ou redes sociais. Assim, temos estas duas definições: (1) recursos são compartilhados entre diversos usuários e alocados com base na demanda; e (2) recursos podem ser acessados, remotamente, usando diversos tipos de dispositivos. Assinale a alternativa que define, corretamente, as características da computação em nuvem para a definição dos trechos anteriores, respectivamente.
Os grids são formados por recursos heterogêneos, englobando clusters, supercomputadores, desktops e até dispositivos móveis, e podem possuir os seguintes elementos: nó mestre (eventualmente, replicado), nós de execução, nós de submissão, interligação e rede de comunicação pública de larga escala: a internet. Identifique se são (V) verdadeiras ou (F) falsas as afirmativas a seguir, que descrevem características dos grids. I. ( ) Pervasividade. II. ( ) Visão uniforme dos recursos computacionais. III. ( ) Armazenamento remoto dos dados. Assinale a alternativa que apresenta a sequência correta.
Os algoritmos probabilísticos também têm impacto significativo em redes e sistemas distribuídos, como na otimização de roteamento e comunicação. Eles utilizam aleatoriedade para explorar caminhos e minimizar conflitos de forma eficiente. Esse uso é essencial em aplicações como redes peer-to-peer e protocolos de consenso em blockchain. Neste contexto, compreenda e associe as descrições aos conceitos correspondentes sobre o problema de balanceamento em Redes Bayesianas:\n\n| Conceitos | Descrição |\n| :--- | :--- |\n| I. Dificuldade de cálculo com muitas variáveis | A. Está associado à dificuldade de calcular probabilidades quando o número de variáveis no grafo aumenta significativamente. |\n| II. Ajuste de pesos para priorização de nós | B. Pode ser resolvido ajustando pesos para priorizar os nós com maior impacto causal. |\n| III. Trade-off entre precisão e custo computacional | C. Refere-se ao equilíbrio entre a precisão do modelo e o custo computacional envolvido. |\n\nAssinale a alternativa que apresenta a associação correta.
Os algoritmos probabilísticos enfrentam desafios relacionados à geração de números verdadeiramente aleatórios. A qualidade da aleatoriedade afeta diretamente a precisão e a robustez dos resultados. Por isso, métodos de geração pseudoaleatória são amplamente estudados para garantir resultados confiáveis em aplicações práticas. Com relação a este contexto e sobre o conteúdo estudado, avalie as asserções a seguir e a relação proposta entre elas.\n\nI. As redes Bayesianas são altamente interpretáveis e permitem a modelagem explícita de relações de dependência entre variáveis.\n\nPORQUE\n\nII. As redes Bayesianas utilizam o Teorema de Bayes e grafos acíclicos direcionados (DAGs) para representar e calcular distribuições de probabilidade conjunta.\n\nA respeito dessas asserções, assinale a alternativa correta.
Leia o trecho a seguir: Em algoritmos probabilísticos, a aleatoriedade é usada para simplificar soluções ou melhorar o desempenho em comparação aos métodos determinísticos. Eles são especialmente úteis em cenários onde a solução exata é computacionalmente inviável, mas uma solução aproximada é suficiente. Exemplos incluem testes de primalidade e algoritmos para encontrar padrões em grandes conjuntos de dados. O classificador Naive-Bayes assume que as variáveis preditoras são [preencher 1] entre si, dado a classe, e utiliza o [preencher 2] para calcular as probabilidades necessárias para a classificação. Os termos [preencher 1] e [preencher 2] são corretamente substituídos por:
Uma aplicação prática para um algoritmo probabilístico é o filtro de spam em e-mails, que utiliza o classificador Naïve Bayes para determinar se uma mensagem é spam ou não. Esse algoritmo calcula a probabilidade de um e-mail ser spam com base na frequência de palavras e outros atributos. Diante do apresentado, assinale a alternativa que identifica a principal característica das redes bayesianas usadas para classificação.
Em computação quântica, algoritmos probabilísticos desempenham um papel fundamental, utilizando propriedades quânticas para gerar soluções probabilísticas rápidas. O algoritmo de Shor, por exemplo, resolve problemas de fatoração de inteiros de forma exponencialmente mais eficiente que os métodos clássicos. Isso demonstra seu potencial revolucionário para criptografia. Analisando os paradigmas de aprendizado de máquina, assinale a alternativa que contém o paradigma que se destaca por utilizar representações explícitas e manipuláveis de conhecimento, como regras lógicas ou árvores de decisão, e tem como principal característica a interpretação clara de suas inferências.
Na ciência de dados, algoritmos probabilísticos são amplamente usados para modelagem estatística e previsão. Os métodos como amostragem de Monte Carlo ajudam a estimar distribuições complexas e realizar inferências em problemas de alta dimensionalidade. Isso os torna ferramentas indispensáveis em finanças, meteorologia e análise de risco.Com relação a este contexto e sobre o conteúdo estudado, examine as asserções a seguir e a relação proposta entre elas.I. Em Redes Bayesianas, a inferência preditiva permite calcular a probabilidade de uma variável alvo com base em valores conhecidos de suas causas ou antecedentes.PORQUEII. As Redes Bayesianas representam somente relações causais diretas e não possibilitam inferências diagnósticas ou baseadas em evidências.A respeito dessas asserções assinale, a alternativa correta.
Uma das aplicações mais conhecidas de algoritmos probabilísticos é o teste de primalidade de números grandes, como o algoritmo Miller-Rabin. Esses métodos baseados em probabilidades tornam verificações rápidas possíveis, mesmo para números com centenas de dígitos. Embora não garantam precisão absoluta, o erro pode ser reduzido ajustando o número de iterações.Diante do apresentado, sobre os tipos de conhecimento de redes bayesianas, observe as afirmativas a seguir:I. O conhecimento causal representa como os efeitos dependem de suas causas e é frequentemente usado para prever consequências.II. O conhecimento diagnóstico se baseia em como as causas explicam os efeitos e é usado para prever causas a partir de evidências observadas.III. Em uma Rede Bayesiana, os dois tipos de conhecimento (causal e diagnóstico) são mutuamente exclusivos e não podem coexistir no mesmo modelo.Está correto o que se afirma em:
O sucesso de um algoritmo probabilístico depende do design cuidadoso para minimizar erros e otimizar resultados. Muitas vezes, esses algoritmos apresentam um "trade-off" entre precisão e desempenho, permitindo personalizações para diferentes aplicações. Isso os torna populares em inteligência artificial, otimização combinatória e biologia computacional.Neste sentido, sobre o classificador Naive Bayes, interprete as afirmativas a seguir:I. O classificador Naive Bayes assume que todos os atributos do conjunto de dados são independentes entre si, dado a classe.II. O classificador Naive Bayes só pode ser aplicado a problemas de classificação binária, não sendo útil para problemas com múltiplas classes.III. O desempenho do classificador Naive Bayes é invariável à presença de atributos irrelevantes no conjunto de dados.Está correto o que se afirma em:
O sistema operacional tem um papel fundamental na construção de clusters de alto desempenho, pois garante o funcionamento primordial das seguintes tarefas:I. Controle de Recursos.
II. Consulta.
III. Monitoração.
IV. Armazenamento seguro dos dados.
Cloud computing, ou computação em nuvem, é uma tecnologia que ganhou muito espaço ultimamente; que permite acesso remoto a recursos computacionais, seja hardware ou software sob demanda; que utiliza, massivamente, tecnologias de virtualização; e que representa uma uma rede global de servidores, tendo cada um deles uma função única. Assinale a alternativa que define, respectivamente: SaaS, PaaS e IaaS.
Os clusters, que trabalham sobre nós de processamento, tendem a ser resistentes a falhas de hardware, software e energia e têm como um dos seus objetivos manter os serviços em operação o maior tempo possível, o que é conhecido como "alta disponibilidade". Nesse contexto, utiliza-se uma técnica para distribuir carga de trabalho de maneira uniforme entre dois ou mais nós, enlaces de comunicação, discos de armazenamento e outros recursos computacionais.Assinale a alternativa que contém, corretamente, o nome da técnica demonstrada pelas características anteriores.
Acerca dos tipos de cluster no contexto de computação escalável é correto afirmar que:I. O cluster de balanceamento de carga depende de 1 ou mais nós balanceadores de carga que será enviada aos servidores que de fato vão processar a carga.
II. O cluster de alta disponibilidade é aquele que tende a se manter resistente a falhas e quando esta ocorre o usuário não percebe.
III. O cluster de alta disponibilidade tem a mesma função que um cluster de alto desempenho.
IV. Cluster de alta disponibilidade é aquele usado para distribuir a carga de trabalho.
Uma outra característica importante dentro do contexto da computação escalável é a utilização de clusters (agrupamentos). Cluster significa uma combinação de dispositivos computacionais interligados por uma rede de comunicação que envolve software e hardware. Com relação aos clusters, avalie as afirmações a seguir, que descrevem as suas características.I. São utilizados para permitir alta disponibilidade.
II. Melhoram a confiabilidade da solução.
III. Permitem muito mais computação do que um computador isolado.
IV. Trabalham sobre nós de processamento denominados de sponsors.Está correto o que se afirma em:
A granularidade é um importante aspecto que precisa ser considerado quando um problema computacional deve ser quebrado em partes para ser processado em paralelo. É também importante considerar esse aspecto quando discutimos a infraestrutura computacional e seus componentes. Analise as afirmações a seguir e escolha a alternativa correta acerca da granularidade relacionada à infraestrutura.I. A granularidade grossa envolve servidores de bancos de dados.
II. A granularidade fina e grossa não impacta no processamento das tarefas.
III. A granularidade é sinônimo de disponibilidade.
IV. A granularidade fina envolve componentes dos servidores como placa-mãe, processadores e memória.
São características fundamentais da Computação em Nuvem segundo o Instituto Nacional de Padrões e Tecnologia do Departamento de Comércio Norte-Americano(NIST):
A metodologia para a construção de um cluster Beowulf envolve:I. Switch.
II. Nós de processamento.
III. Computador usado como servidor com apenas uma placa de rede.
IV. Um sistema operacional escolhido de acordo com a sua capacidade técnica.
Uma aplicação de árvores de decisão na área médica é o diagnóstico de doenças. Um exemplo comum é o uso de árvores de decisão para identificar se um paciente tem diabetes com base em variáveis como idade, índice de massa corporal ($IMC$), nível de glicose no sangue, pressão arterial e histórico familiar. Neste sentido, sobre indução de árvores de decisão e regressão em aprendizado de máquina, observe as afirmativas a seguir:I. As árvores de decisão são usadas tanto para tarefas de classificação quanto de regressão.
II. O critério "Impureza de Gini" é utilizado para medir a qualidade de divisões em árvores de decisão para regressão.
III. As árvores de regressão realizam divisões nos dados com base em uma métrica de erro, como o erro quadrático médio ($MSE$).Está correto o que se afirma em:
Aprendizado supervisionado é uma abordagem onde o modelo aprende a partir de dados rotulados. O objetivo é mapear entradas a saídas desejadas com base em exemplos fornecidos durante o treinamento. Técnicas comuns incluem regressão linear e árvores de decisão. Aplicações incluem classificação de imagens e previsão de preços. Em aprendizado de máquina, as tarefas preditivas e descritivas diferem em seus objetivos. Nesse sentido, assinale a alternativa que reconhece corretamente a principal diferença entre essas duas categorias.
A computação paralela, definida como o uso simultâneo de múltiplos recursos computacionais para resolver um problema e que representa uma das aplicações para a computação escalável, pode possuir mais de uma solução para atender ao processamento em paralelo.Baseando-se na possibilidade de mais de uma solução para a computação paralela, identifique se são (V) verdadeiras ou (F) falsas as afirmativas a seguir.I. ( ) Um único computador com múltiplos processadores representa uma das possibilidades de solução para a computação paralela.
II. ( ) Um número arbitrário de computadores conectados pela rede representa uma das possibilidades de solução para a computação paralela.
III. ( ) Uma combinação de um único computador com múltiplos processadores e um número arbitrário de computadores conectados pela rede representa uma das possibilidades de solução para a computação paralela.Assinale a alternativa que apresenta a sequência correta.
A computação paralela, um dos processos computacionais que atende às premissas da computação escalável, possui, assim como quaisquer áreas da computação, os seus “jargões”, palavras e termos que representam os seus processos. Analise o trecho a seguir:Define o tamanho do trabalho atribuído a cada thread antes que elas se sincronizem. Indica a relação entre computação e comunicação dos trechos de código gerados a partir da divisão do problema a ser resolvido.Assinale a alternativa que define, corretamente, o termo da computação paralela para a definição do trecho anterior.
Os bancos e instituições financeiras utilizam árvores de decisão para avaliar se um cliente é um bom pagador ou inadimplente, considerando variáveis como renda, histórico de crédito, idade e nível de endividamento. A árvore de decisão divide os clientes em categorias com base nesses critérios, ajudando na tomada de decisões sobre concessão de empréstimos.Diante do apresentado sobre árvores de decisão, leia as afirmativas a seguir:I. As árvores de decisão são modelos baseados em uma estrutura hierárquica que divide os dados em subconjuntos com base em critérios de divisão.
II. As árvores de decisão funcionam exclusivamente em tarefas de classificação e não podem ser aplicadas a problemas de regressão.
III. O treinamento de uma árvore de decisão envolve escolher divisões que maximizem a homogeneidade dos subconjuntos resultantes.Está correto o que se afirma em:
O aprendizado por reforço é um paradigma de aprendizado de máquina no qual um agente interage com um ambiente e aprende a tomar decisões por meio de tentativa e erro, recebendo recompensas ou penalidades como feedback. O objetivo do agente é maximizar a recompensa acumulada ao longo do tempo, desenvolvendo uma política ótima para suas ações com base nas experiências adquiridas.Nesse sentido, assinale a alternativa que identifica qual processo é fundamental para o funcionamento de um algoritmo de aprendizado de máquina.