quinta-feira, 14 de outubro de 2010

Particionamento no PowerCenter - Pipeline Partitioning

Escrevo este post sobre um dos temas mais importantes sobre o PowerCenter atualmente, o Particionamento. Por ser um recurso precioso de otimização de carga e que a maioria das empresas possuem comprado, os desenvolvedores devem conhecer, no mínimo, os principais tipos de particionamento e onde pode ser aplicado no seu dia-a-dia. São estas informações que eu trago no texto abaixo.

Quando usar Particionamento?
Algumas vezes necessitamos de acelerar a entrega das informações de uma determinada carga e podemos utilizar nesses casos o plug-in de Particionamento do PowerCenter. Com este plug-in podemos criar até 64 threads (partições) para acelerarmos o tempo de execução de um processo demorado.

Como usar Particionamento?
A partir de um mapa construído, é preciso apenas na sessão ser definida a quantidade de partições (threads) que você quer utilizar e selecionar o tipo apropriado em cada transformation. Dessa forma, não é necessário construir um mapa “próprio” para ser particionado, como é o caso atualmente do DataStage Parallel.

Tipos de Particionamento:

Pass-Through
Este é o tipo de Particionamento mais comum. Os dados de cada partição não são reorganizados quando você usa este tipo. Os dados de cada partição continuam na mesma partição ao passar por uma transformation com este tipo de particionamento configurado.

Hash Auto-Keys
O próprio PowerCenter define por qual campo os dados irão ser organizados na partição por um valor hash interno. Normalmente utilizamos este tipo de particionamento em sorter, joiner e aggretator. Dessa forma, o PowerCenter agrupa os dados de acordo com o campo que é feita a ordenação, a condition ou o group by, respectivamente.

Hash User-Keys
O usuário define o campo que deseja q o PowerCenter organize os dados utilizando um campo interno de hash.

Round-Robin
O intuito deste tipo de Particionamento é fazer o balanceamento da quantidade dos dados nas partições criadas. Suponha que você tenha uma sessão com 4 partições: a primeira possui 1000 registros, a segunda 10, a terceira 90 e a quarta 100. Utilizando este tipo de Particionamento os dados serão reorganizados de forma que cada partição tenha 1200/4=300 registros. Isto é útil para a distribuição correta de CPU/memória para processamento dos dados e sincronização da finalização de carga de cada partição.

Key-Range
Para este tipo, o usuário pode definir o intervalo de dados de um determinado campo que deseja dividir por cada partição. Se você quiser dividir, por exemplo, pessoas do sexo masculino e feminino em duas partições e gravar em arquivos separadamente, basta usar este Particionamento.

Database Partitioning
Você pode utilizar este tipo de partição em sources e targets, definindo nos mesmos, a partição que está criada fisicamente no banco de dados.

Cuidados ao utilizar Particionamento
O maior cuidado em usar Particionamento é definir o tipo correto em cada transformation. Caso você não defina o tipo correto, quando você utilizar joiner e aggregator, por exemplo, os dados podem ser gerados inconsistentes.

Quando definimos partições na sessão, podemos definir o tipo de merge dos arquivos gerados. O padrão é o Seqüencial Merge. Neste tipo de merge os arquivos gerados das partições são gravados seqüencialmente num único arquivo. Usando o Cuncorrent Merge, não são gerados os arquivos outputs temporários. O arquivo de merge é gerado de acordo com que os dados são gravados em cada partição. Este segundo tipo de merge costuma ser mais rápido.

Pontos que poderiam melhorar
Para a extração de dados de um banco de dados usando particionamento precisamos definir manualmente o SQL ou o intervalo de registros que queremos que os dados sejam buscados. Poderia ser implementado no PowerCenter uma distribuição automática de uma tabela no banco pelas partições criadas, utilizando, por exemplo, o intervalo de rowid de cada partição. Essa característica está presente atualmente no Datastage Parallel.

Abraço a todos.
Marcos David M Caliman

sexta-feira, 9 de julho de 2010

Informatica PowerCenter 9 - New Features

Pessoal,

Como eu ainda não consegui usar a versão 9 do PowerCenter, iniciei uma pesquisa na internet sobre as novidades desta ferramenta.

Uma nova funcionalidade que a nova versão traz, que todo mundo sentia falta, é o uso de SQL override numa lookup que não possui cache. Essa nova opção vai ajudar e muito na otimização de mapas já construídos e traz uma nova opção daqui pra frente. O Data Stage, por exemplo, já possui esta funcionalidade através das lookups em OCI´s a muito tempo.

Uma outra novidade é que uma lookup agora pode retornar múltiplos registros e não somente um, como era até a versão 8. Uma lookup então se torna uma "active transformation".

Na nova versão também, o Powercenter Admin Console mudou de nome. Agora ele é chamado de Informatica Administrator, cuja interface foi redesenhada.

Ouvi dizer em um forum na it.toolbox.com que nesta versão será possível fazer loader no Teradata em mapas particionados. Vamos esperar pra conferir se isto realmente será possível.

No mais, deixo aberto este tópico para comentários de pessoas que já estão usando a versão 9 e que podem contribuir com mais algumas novidades desta versão.

Abraço a todos.
Marcos David M. Caliman

quarta-feira, 30 de junho de 2010

Forrester: Powercenter é líder em ETL

Maurício Renner - segunda-feira, 07/06/2010 - 11:38

O PowerCenter, principal produto da fornecedora de software de integração de dados Informatica Corporation foi reconhecido pela Forrester Research como a ferramenta de ETL mais utilizadas pelas empresas.

Metade dos profissionais de TI familiarizados com integração de dados utilizam a solução da Informatica Corporation.

Nos últimos anos, a Informatica fez aquisições nas áreas de gerenciamento de MDM (Master Data Management) para qualidade de dados, gerenciamento do ciclo de vida das informações, integração em nuvem, processamento de eventos complexos, troca de dados B2B e troca de mensagens de alta performance.

Fundamental
O relatório Enterprise ETL: Evolving And Indispensible To Your Data Management Strategy, desenvolvido pela Forrester Research, em maio de 2010, mostra que cerca de 50% dos entrevistados disseram considerar o ETL imprescindível para suas operações diárias e que aproximadamente três quartos das empresas pretendem expandir o uso de ETL no próximo ano.

Ainda de acordo com o estudo, a classificação e o gerenciamento de metadados são as soluções complementares mais compradas de fornecedores de ETL, seguidas de software de gerenciamento de qualidade de dados.

A Forrester destaca, ainda, que as empresas deveriam migrar suas soluções customizadas para soluções ETL comerciais.

Fonte: http://www.baguete.com.br/noticias/software/07/06/2010/forrester-powercenter-e-lider-em-etl

quinta-feira, 13 de maio de 2010

Matar Worklow no PowerCenter

Alguma vezes, quando desejamos parar a execução de um workflow usando apenas as funções stop ou abort, não temos êxito e o status do workflow fica "eternamente" como running.

Nestes casos, quando o servidor está instalado em ambiente UNIX, podemos utilizar o comando kill para "matar" este workflow ativo.

O número do processo (pid) do workflow pode ser encontrado na sexta linha do log da execução do mesmo:

"Session task instance [s_TESTE]: started a process with pid [820] on node [node_caliman]."

Então, para esse workflow, bastaria executar o comando abaixo:

kill -9 820

Abraço a todos,

Marcos David M Caliman

quinta-feira, 1 de abril de 2010

Banco Popular foca qualidade dos dados

Decision Report, 31/03/2010

Terceira maior instituição financeira espanhola, o Banco Popular acaba de adotar a solução Informatica Data Quality, da Informatica Corporation, para melhorar a qualidade dos dados processados pela companhia e aumentar a eficácia de suas campanhas de negócios.

Essa implementação é parte de uma iniciativa em andamento que visa ao aperfeiçoamento das operações do banco e à atração e retenção de clientes. A nova ferramenta ajudará a companhia a oferecer produtos sob medida e de forma oportuna à base de clientes.

Em dezembro de 2008, o banco estabeleceu, junto com o departamento de TI, uma divisão com a finalidade de examinar a qualidade das informações utilizadas. Isso foi feito devido à consciência de que os clientes devem ser abordados com ofertas de produtos que realmente atendam a suas necessidades. Para isso, precisão é indispensável.

A Divisão de Qualidade do banco publica, mensalmente, um Índice de Qualidade de Dados baseado em 23 variáveis, que assegura a completude e a fidelidade das informações. Essas 23 categorias incluem campos como nome, data de nascimento, formação e os códigos CNAE (classificação nacional de atividades econômicas) e CNO (título profissional).

Todos esses campos são classificados como obrigatórios, necessários ou desejáveis, ou seja, são ligados a questões de conformidade regulatória, a requisitos de negócios e a informações úteis em relação a preferências e interesses do cliente.

Processo otimizado

Antes da implementação do Informatica Data Quality, a distinção entre os tipos de variações era feita por meio de programação manual, um processo de grande complexidade devido ao acréscimo de novos requisitos. Por essa razão, o Banco Popular avaliou diversas ferramentas de automação de qualidade de dados optando pela solução da Informatica Corporation.

Como o Banco Popular Group já utilizava outra ferramenta da companhia, o Informatica PowerCenter, para fazer a integração de dados provenientes de todos os sistemas do banco, foi possível reaproveitar a estrutura desenvolvida para esse projeto.

“Em vista dos resultados obtidos em uma prova de conceito com 280 mil registros, o Banco Popular escolheu o Informatica Data Quality”, afirma o diretor da Divisão de Qualidade do Banco Popular, Alberto Romero. As vantagens proporcionadas pelo software incluem um dicionário completo dos domínios existentes, que é essencial para lançar ofertas por e-mail, e o fato de ser muito fácil de usar, mesmo quando os usuários não têm formação técnica.

Motivada com os resultados da prova de conceito, a instituição pretende fazer com que a solução seja usada pelas áreas de negócios. “Nosso intuito é envolver as pessoas da área de negócios — das agências às diretorias regionais — para que essa disciplina não seja mais vista como uma tarefa que compete exclusivamente ao departamento de TI. Isso também torna as estratégias de negócios mais eficazes”, complementa.

Automação e economia de tempo

Uma das maiores vantagens da implementação prevista para 2010 é aumento da independência e autonomia da Divisão de Qualidade da instituição, que se tornará capaz de definir suas próprias regras sem depender do cronograma das equipes de desenvolvimento. É esperado, ainda, que o nível de qualidade de dados registrado no relatório mensal chegue a 90% em todas as variáveis - atualmente esse valor gira em torno de 74%.

Da mesma forma, a automação do processo como um todo resultará em significativa economia do tempo gasto pela equipe técnica da Divisão de Qualidade, que poderá se dedicar a análises aprofundadas de todas as informações. Além disso, a solução reforçará a capacidade da empresa para acompanhar as mudanças nos requisitos regulatórios que dizem respeito ao gerenciamento e à proteção de dados no setor financeiro.

Fonte:
http://www.decisionreport.com.br/publique/cgi/cgilua.exe/sys/start.htm?infoid=6163&sid=1

segunda-feira, 1 de fevereiro de 2010

Quadrante Mágico para Ferramentas de Integração de Dados - Gartner NOV/2009

Pessoal,

Segue abaixo trecho retirado do mais recente relatório do Gartner, divulgado em novembro de 2009, sobre ferramentas de integração de dados.
A Informatica segue como líder de mercado, seguida por perto pela IBM:



Pontos Fortes

- É o fornecedor mais reconhecido no mundo empresarial.

- Apesar das condições do mercado de 2009 e forte concorrência, a Informatica tem continuado a crescer, organicamente e através de aquisições.

-Lançamento da versão 9, que reúne a integração de dados e a qualidade de dados, alinhado com a nova tendência do mercado de consolidação destas duas classes de tecnologia.


Cuidados

- Forte concorrência de grandes fornecedores (IBM, Microsoft, Oracle e SAP).

- É uma das soluções de integração de dados mais caras do mercado e continua enfrentando um concorrentes com menores custos

sexta-feira, 22 de janeiro de 2010

Artigo sobre Performance e Conceitos atuias do PowerCenter 8

Segue abaixo o link do artigo “Getting the most out of your Informatica PowerCenter 8 Environment”.

Este artigo é muito interessante para desenvolvedores e analistas que trabalham com o PowerCenter 8 e destaca os conceitos atuais sobre performance e a arquitetura 64 bits.

http://www.element61.be/e/resourc-detail.asp?ResourceId=57

Abraço
Marcos David M Caliman