top 32 best datastage interview questions
Lista das perguntas e respostas mais frequentes da entrevista do Datastage para ajudá-lo a se preparar para a próxima entrevista:
DataStage é uma ferramenta ETL muito popular que estava disponível no mercado atual.
Neste artigo, estou compartilhando um conjunto de respostas de perguntas muito úteis destinadas a entrevistas do IBM Datastage. Analisar as perguntas da entrevista do Datastage abaixo pode tornar mais fácil para você desvendar a entrevista.
Cobrimos respostas detalhadas às perguntas da entrevista do Datastage, que serão úteis para caloiros e profissionais experientes.
Leitura recomendada => ETL testando perguntas da entrevista
Perguntas e respostas mais comuns da entrevista do Datastage
Vamos começar!
P # 1) O que é Datastage?
Respostas: Datastage é um Ferramenta ETL dado por IBM que utiliza uma GUI para projetar soluções de integração de dados. Esta foi a primeira ferramenta ETL que deu um conceito de paralelismo.

Está disponível nas seguintes 3 edições diferentes
- Server Edition
- Enterprise Edition
- Edição MVS
P # 2) Destacar os principais recursos do Datastage?
Respostas: Os principais recursos do Datastage são destacados abaixo:
- É o componente de integração de dados do servidor de informações IBM Infosphere.
- É uma ferramenta baseada em GUI. Precisamos apenas arrastar e soltar os objetos Datastage e podemos convertê-los em código Datastage.
- É usado para realizar as operações ETL (Extrair, Transformar, Carregar)
- Ele fornece conectividade para várias fontes e vários destinos ao mesmo tempo
- Ele fornece técnicas de particionamento e processamento paralelo que permitem que as tarefas do Datastage processem um grande volume de dados com bastante rapidez.
- Possui conectividade de nível empresarial.
P # 3) Quais são os principais usos da ferramenta Datastage?
Respostas: Datastage é uma ferramenta ETL usada principalmente para extrair dados de sistemas de origem, transformando esses dados e finalmente carregando-os para sistemas de destino.
P # 4) Quais são as principais diferenças que você observou entre as versões 7.xe 8.x do DataStage?
Respostas: Aqui são as principais diferenças entre as duas versões
| 7.x | 8.x |
|---|---|
| A versão 7.x era dependente da plataforma | Esta versão é independente de plataforma |
| Possui arquitetura de 2 camadas, onde o armazenamento de dados é construído em cima do servidor Unix | Possui arquitetura de 3 camadas, onde temos o banco de dados do servidor UNIX na parte inferior, o banco de dados XMETA que atua como um repositório e, em seguida, temos o banco de dados no topo. |
| Não há conceito de conjunto de parâmetros | Temos conjuntos de parâmetros que podem ser usados em qualquer lugar do projeto. |
| Tínhamos designer e gerente como dois clientes separados | Nesta versão, o cliente gerente foi mesclado com o cliente designer |
| Tivemos que procurar manualmente os empregos nesta versão | Aqui temos a opção de busca rápida no repositório onde podemos pesquisar facilmente os empregos. |
P # 5) Você pode destacar os principais recursos do servidor de informações IBM Infosphere?
Respostas: Os principais recursos do pacote de servidores de informações IBM Infosphere são:
melhor aplicativo de quadro de horários para vários funcionários
- Ele fornece uma plataforma única para integração de dados. Ele tem a capacidade de se conectar a vários sistemas de origem, bem como gravar em vários sistemas de destino.
- É baseado em camadas centralizadas. Todos os componentes da suíte podem compartilhar a arquitetura básica da suíte.
- Possui camadas para o repositório unificado, para serviços de metadados integrados e um mecanismo paralelo comum.
- Ele fornece ferramentas para análise, limpeza, monitoramento, transformação e entrega de dados.
- Possui recursos de processamento massivamente paralelo. Acontece que o processamento é muito rápido.
P # 6) Quais são as diferentes camadas da arquitetura do servidor de informações?
Respostas: Abaixo estão as diferentes camadas da arquitetura do servidor de informação
- Interface de usuário unificada
- Serviços comuns
- Processamento paralelo unificado
- Metadados Unificados
- Conectividade comum
P # 7) O que poderia ser um sistema de fonte de dados?
Respostas: Pode ser uma tabela de banco de dados, um arquivo simples ou até mesmo um aplicativo externo como o People Soft.
P # 8) Em qual interface você trabalhará como desenvolvedor?
Respostas: Como desenvolvedor do Datastage, trabalhamos na interface do cliente do Datastage, que é conhecido como um designer do Datastage que precisa ser instalado no sistema local. No back-end, ele está conectado ao servidor Datastage.
P # 9) Quais são os diferentes serviços comuns no Datastage?
Respostas: Abaixo está a lista de serviços comuns no Datastage:
- Serviços de metadados
- Implantação de serviço unificado
- Serviços de segurança
- Serviços de loop e relatórios.
P # 10) Como você começa a desenvolver um projeto Datastage?
Respostas: A primeira etapa é criar um trabalho Datastage no servidor Datastage. Todos os objetos Datastage que criamos são armazenados no projeto Datastage. Um projeto Datastage é um ambiente separado no servidor para trabalhos, tabelas, definições e rotinas.
Um projeto Datastage é um ambiente separado no servidor para trabalhos, tabelas, definições e rotinas.
Q # 11) O que é um trabalho DataStage?
Respostas: O trabalho do Datastage é simplesmente um código DataStage que criamos como um desenvolvedor. Ele contém diferentes estágios vinculados para definir os dados e o fluxo do processo.
As etapas nada mais são do que as funcionalidades implementadas.
Por exemplo: Vamos supor que eu queira fazer uma soma do valor das vendas. Esta pode ser uma operação 'agrupar por' que será realizada em um estágio.
Agora, quero gravar o resultado em um arquivo de destino. Portanto, esta operação será realizada em outra etapa. Depois de definir os dois estágios, preciso definir o fluxo de dados do meu estágio ‘agrupar por’ para o estágio do arquivo de destino. Este fluxo de dados é definido por links DataStage.
Depois de definir os dois estágios, preciso definir o fluxo de dados do meu estágio ‘agrupar por’ para o estágio do arquivo de destino. Este fluxo de dados é definido por links DataStage.

P # 12) O que são sequências do DataStage?
Respostas: A sequência do Datastage conecta as tarefas do DataStage em um fluxo lógico.
P # 13) Se você deseja usar o mesmo trecho de código em trabalhos diferentes, como você fará isso?
Respostas: Isso pode ser feito usando contêineres compartilhados. Compartilhamos contêineres para reutilização. Um contêiner compartilhado é um elemento de tarefa reutilizável que consiste em estágios e links. Podemos chamar um contêiner compartilhado em diferentes trabalhos do Datastage.
P # 14) Onde os trabalhos do Datastage são armazenados?
Respostas: Os trabalhos do Datastage são armazenados no repositório. Temos várias pastas nas quais podemos armazenar os trabalhos do Datastage.
P # 15) Onde você vê os diferentes estágios do designer?
Respostas: Todos os estágios estão disponíveis em uma janela chamada ' Paleta ' . Possui várias categorias, dependendo do tipo de função que o palco fornece.
As várias categorias de estágios na Paleta são - Geral, Qualidade de Dados, Banco de Dados, Desenvolvimento, Arquivo, Processamento, etc.
Q # 16) Quais são os estágios de processamento?
Respostas: Os estágios de processamento nos permitem aplicar a transformação de dados real.
Por exemplo , O ' O estágio de agregador 'na categoria Processamento nos permite aplicar todas as operações' agrupar por '. Da mesma forma, temos outros estágios de processamento, como o estágio de ‘Junção’, que nos permite juntar os dados provenientes de dois fluxos de entrada diferentes.
P # 17) Quais são as etapas necessárias para criar um trabalho básico simples do Datastage?
Respostas: Clique em Arquivo -> Clique em Novo -> Selecionar Trabalho Paralelo e clique em OK. Uma janela de trabalho paralela será aberta. Neste trabalho paralelo, podemos reunir diferentes estágios e definir o fluxo de dados entre eles. A tarefa mais simples do DataStage é uma tarefa ETL.
Nesse caso, primeiro precisamos extrair os dados do sistema de origem para os quais podemos usar um estágio de arquivo ou um estágio de banco de dados, porque meu sistema de origem pode ser uma tabela de banco de dados ou um arquivo.
Suponha que estejamos lendo dados de um arquivo de texto. Neste caso, vamos arrastar e soltar o estágio ‘Arquivo sequencial’ para a janela de trabalho paralelo. Agora, precisamos realizar alguma transformação com base nesses dados. Usaremos o estágio 'Transformador' que está disponível na categoria Processamento. Podemos escrever qualquer lógica no estágio Transformer.
Finalmente, precisamos carregar os dados processados em alguma tabela de destino. Digamos que meu banco de dados de destino seja o DB2. Portanto, para isso, selecionaremos o estágio do conector do DB2. Em seguida, estaremos conectando esses estados de dados por meio de links sequenciais.
Depois disto , precisamos configurar os estágios para que apontem para o sistema de arquivos ou banco de dados correto.
Por exemplo, Para o estágio de arquivo sequencial, precisamos definir os parâmetros obrigatórios, como nome do arquivo, localização do arquivo e metadados da coluna.
Em seguida, precisamos compilar o trabalho Datastage. Compilar o trabalho verifica a sintaxe do trabalho e cria um arquivo executável para o trabalho Datastage que pode ser executado em tempo de execução.
Q # 18) Nomeie os diferentes métodos de classificação no Datastage.
aplicativo Android para espionar outro telefone
Respostas: Existem dois métodos disponíveis:
- Classificação de link
- Classificação de armazenamento de dados embutida

P # 19) Em um lote, se um trabalho falhar no meio e você quiser reiniciar o lote a partir desse trabalho específico e não do zero, o que você fará?
Respostas: No Datastage, há uma opção na sequência de tarefas - ‘Adicionar pontos de verificação para que a sequência possa ser reiniciada em caso de falha’ . Se esta opção estiver marcada, podemos executar novamente a sequência de tarefas a partir do ponto em que falhou.
P # 20) Como você importa e exporta os trabalhos do Datastage?
Respostas: F ou isto, abaixo das funções de linha de comando para este
- Importar: dsimport.exe
- Exportar: dsexport.exe
P # 21) O que são rotinas no Datastage? Aliste vários tipos de rotinas.
Respostas: Rotina é um conjunto de funções definidas pelo gerenciador DS. É executado através do estágio do transformador.
Existem 3 tipos de rotinas:
- Rotinas paralelas
- Rotinas de mainframe
- Rotinas de servidor

P # 22) Como você remove valores duplicados no DataStage?
Respostas: Existem duas maneiras de lidar com valores duplicados
- Podemos usar o estágio de remoção de duplicatas para eliminar duplicatas.
- Podemos usar o estágio de classificação para remover duplicatas. O estágio de classificação tem uma propriedade chamada 'permitir duplicatas'. Não obteremos valores duplicados na saída de classificação ao definir essa propriedade igual a false.
P # 23) Quais são os diferentes tipos de visualizações disponíveis em um Datastage director?
Respostas: Existem 3 tipos de visualizações disponíveis no Datastage director. Eles estão:
- Visualização de registro
- Visualização de status
- Visualização de trabalho
P # 24) Distinguir entre Informatica e Datastage. qual você escolheria e porque?
Respostas: Tanto o Informatica quanto o DataStage são ferramentas ETL poderosas.
Os pontos alistados diferenciam as duas ferramentas:
| Informática | Datastage | |
|---|---|---|
| Processamento paralelo | A Informatica não oferece suporte para processamento paralelo. | Em contraste com isso, o armazenamento de dados fornece mecanismo para processamento paralelo. |
| Implementando SCDs | É muito simples implementar SCDs (dimensões que mudam lentamente) na Informatica. | No entanto, é complexo implementar SCDs em armazenamento de dados. O Datastage oferece suporte a SCDs apenas por meio de scripts personalizados. |
| Controle de versão | A Informatica oferece suporte ao controle de versão por meio de check-in e check-out de objetos. | No entanto, não temos essa funcionalidade disponível no armazenamento de dados. |
| Transformações Disponíveis | Transformações menores estão disponíveis. | O Datastage oferece mais variedade de transformações do que a Informatica. |
| Poder de pesquisa | A Informatica fornece pesquisa de cache dinâmica muito poderosa | Não temos nada semelhante em armazenamento de dados. |
Na minha opinião pessoal, eu escolheria a Informatica em vez do Datastage. O motivo é que considero a Informatica mais sistemática e amigável do que o DataStage.
Outro forte motivo é que a depuração e o tratamento de erros são muito melhores na Informatica em comparação com o Datastage. Portanto, corrigir problemas se tornou mais fácil na Informatica. O Datastage não oferece suporte completo ao tratamento de erros.
=> Quer saber mais sobre a Informatica? Nós temos uma explicação detalhada aqui.
Q # 25) Dê uma ideia das variáveis do sistema.
Respostas: Variáveis do sistema são as variáveis somente leitura começando com ‘@’ que pode ser lido pelo estágio do transformador ou pela rotina. Eles são usados para obter as informações do sistema.
Q # 26) Qual é a diferença entre estágio passivo e estágio ativo?
Respostas: Os estágios passivos são utilizados para extração e carregamento, enquanto os estágios ativos são utilizados para a transformação.
P # 27) Quais são os vários tipos de contêineres disponíveis no Datastage?
Respostas: Temos abaixo de 2 contêineres no Datastage:
- Container local
- Container compartilhado
P # 28) O valor da variável de teste é armazenado temporariamente ou permanentemente?
Respostas: Temporariamente. É uma variável temporária.
P # 29) Quais são os diferentes tipos de trabalhos no Datastage?
Respostas: Temos dois tipos de trabalhos no Datastage:
- Trabalhos do servidor (eles são executados de maneira sequencial)
- Tarefas paralelas (são executadas de forma paralela)
P # 30) Qual é o uso do Datastage director?
Respostas: Por meio do Datastage director, podemos agendar um trabalho, validar o trabalho, executar o trabalho e monitorar o trabalho.
P # 31) Quais são os vários tipos de arquivo hash?
Respostas: Temos 2 tipos de arquivos hash:
- Arquivo hash estático
- Arquivo hash dinâmico
Q # 32) O que é um estágio de qualidade?
Respostas: O estágio de qualidade (também chamado de estágio de integridade) é um estágio que auxilia na combinação de dados provenientes de diferentes fontes.
Conclusão
Você deve ter um conhecimento prático sobre a arquitetura do Datastage, seus principais recursos e deve ser capaz de explicar como ele é diferente de algumas outras ferramentas ETL populares.
Além disso , você deve ter uma ideia justa sobre os diferentes estágios e seu uso, uma maneira de ponta a ponta de criar um trabalho Datastage e executá-lo.
declarar uma matriz de string em java
Leitura Recomendada => O que é o teste ETL?
Tudo de bom!
Leitura recomendada
- Perguntas e respostas da entrevista de teste de ETL
- As 10 melhores ferramentas de mapeamento de dados úteis no processo ETL (2021 LIST)
- 15 melhores ferramentas ETL em 2021 (uma lista atualizada completa)
- Tutorial de teste de data warehouse com exemplos | Guia de teste ETL
- Teste ETL Tutorial de teste de data warehouse (um guia completo)
- ETL vs. Teste de banco de dados - Uma análise mais detalhada da necessidade de teste de ETL, planejamento e ferramentas de ETL
- Como realizar testes de ETL usando a ferramenta Informatica PowerCenter
- Metadados em Data Warehouse (ETL) explicados com exemplos
- Comunicado à imprensa - iCEDQ Soft Nova versão da plataforma de teste de ETL e migração de dados
- As 10 principais ferramentas de teste de ETL em 2021
- O que é o processo ETL (Extract, Transform, Load) no Data Warehouse?