Pular para o conteúdo

Datadog, New Relic ou Grafana: qual escolher para sua empresa

Datadog ou Grafana? Compare também com o New Relic: custo por volume de dados, onde ficam os logs, quem opera a ferramenta e quando cada opção vale a pena.

Por · LinkedIn 13 min de leitura
Neste artigo

O sistema caiu numa segunda de manhã e foram duas horas até alguém descobrir que o problema era um certificado vencido numa integração. Depois de uma manhã assim, a pergunta chega à diretoria: "precisamos de uma ferramenta de monitoramento. Datadog, New Relic ou Grafana?"

As três funcionam. O que muda é o modelo: de um lado, plataformas completas vendidas como serviço; do outro, uma pilha aberta, gerenciada ou instalada na sua própria infraestrutura. A escolha depende menos da lista de recursos e mais do tamanho da sua operação e de quem, de fato, vai cuidar da ferramenta depois de instalada.

Este texto não substitui a avaliação com cada fornecedor: recursos e modelos de cobrança mudam com frequência e devem ser confirmados diretamente com eles.

Resposta curta: se a equipe é pequena e precisa de logs, métricas e traces correlacionados sem montar nada, uma plataforma completa como Datadog ou New Relic costuma ser o caminho mais rápido, desde que alguém controle o volume de dados enviado. Se a empresa quer controle sobre retenção, sobre onde o dado fica e sobre o custo por volume, e tem alguém com disciplina para operar, a pilha Grafana (Prometheus, Loki e Tempo), gerenciada ou auto-hospedada, tende a servir melhor. O critério que desempata é o que precisa ser respondido quando o sistema cai.

O que uma ferramenta de observabilidade precisa responder

Antes de comparar marcas, escreva as perguntas que a ferramenta precisa responder no pior momento. Quase sempre são estas:

  • Está fora do ar ou só lento? E para quem: todos os usuários, uma filial, um tipo de operação?
  • Desde quando? O problema começou depois de um deploy, de uma mudança de configuração, de um pico de acesso?
  • Onde está o gargalo? No banco de dados, numa integração externa, na fila, no servidor, na rede?
  • Quem precisa saber agora? E essa pessoa foi avisada antes do cliente reclamar?

Para responder isso, a ferramenta trabalha com três tipos de sinal. Métricas mostram números ao longo do tempo: uso de CPU, tempo de resposta, quantidade de erros. Logs registram o que aconteceu em cada evento. Traces seguem uma requisição de ponta a ponta, passando por todos os serviços que ela toca. Explicamos esses três sinais em detalhe em observabilidade na prática: logs, métricas e traces.

O ponto importante para a decisão é a correlação: conseguir sair de um alerta de lentidão, chegar ao trace da requisição lenta e abrir o log exato daquele momento, sem copiar horário de uma tela para outra. É aí que os dois modelos se diferenciam.

Saber que o sistema está lento é monitoramento; saber por que está lento é diagnóstico, e exige dados mais ricos. Veja como diagnosticar um sistema lento antes de escalar.

Datadog e New Relic: plataforma completa como serviço

Datadog e New Relic são plataformas de observabilidade no modelo SaaS. Você instala um agente ou uma biblioteca de instrumentação no sistema, os dados são enviados para a nuvem do fornecedor, e logs, métricas, traces, painéis e alertas ficam num só lugar, prontos para uso.

O que esse modelo faz muito bem:

  • Começo rápido. Não há servidor de monitoramento para manter nem atualização para aplicar. A equipe instrumenta o sistema e já tem painéis.
  • Correlação pronta. Como tudo está na mesma plataforma, navegar de uma métrica para o trace e do trace para o log é parte do produto.
  • Integrações. Ambos oferecem catálogos de integrações com provedores de nuvem, bancos de dados, filas e ferramentas de comunicação, além de API para automação.

Onde é preciso atenção:

  • O volume cresce sem pedir licença. Em plataformas que cobram por dado ingerido, por host ou por usuário, cada log a mais, cada serviço novo e cada métrica com muitos rótulos entram na conta. Sem política de volume, a fatura acompanha o crescimento do sistema, e às vezes passa à frente dele.
  • O dado mora no fornecedor. Para muitas empresas isso é aceitável. Para outras, com exigência contratual, regulatória ou de LGPD sobre onde ficam logs que podem conter dados pessoais, é um ponto a verificar com cuidado. Detalhamos essa questão em dados na nuvem no Brasil e LGPD.
  • Sair dá trabalho. Painéis, alertas e instrumentação proprietária precisam ser refeitos numa migração. Instrumentar com um padrão aberto como o OpenTelemetry reduz esse custo de troca.

Entre Datadog e New Relic, a diferença para uma empresa média costuma estar mais no modelo de cobrança, na facilidade de uso para o seu time e nas integrações que você usa. Faça uma prova de conceito com os dois, com dados reais, antes de assinar.

Grafana e a pilha aberta: Prometheus, Loki e Tempo

Grafana é uma ferramenta de visualização de código aberto, criada para montar painéis a partir de várias fontes de dados. Em volta dela existe uma pilha também aberta, em que cada peça cuida de um sinal:

  • Prometheus coleta e armazena métricas.
  • Loki armazena e consulta logs.
  • Tempo armazena traces.

Essa pilha pode ser usada de dois jeitos. Auto-hospedada: você instala e opera tudo na sua própria nuvem ou servidor. Gerenciada: a Grafana Labs, empresa por trás do projeto, oferece uma versão como serviço, e há provedores de nuvem com ofertas gerenciadas de algumas dessas peças.

O que esse caminho faz muito bem:

  • Controle sobre o dado. Na versão auto-hospedada, logs e métricas ficam na sua infraestrutura, na região que você escolher.
  • Controle sobre retenção. Você decide quanto tempo guardar cada tipo de dado e em que tipo de armazenamento, o que muda bastante o custo quando o volume é grande.
  • Padrões abertos. Prometheus e OpenTelemetry são padrões muito difundidos. Trocar uma peça da pilha é menos traumático do que trocar uma plataforma inteira.

Onde é preciso atenção:

  • Alguém precisa operar. Na versão auto-hospedada, a ferramenta de monitoramento vira mais um sistema em produção: precisa de atualização, backup, dimensionamento e monitoramento dela mesma. Se ela cair junto com o sistema principal, você fica cego exatamente quando mais precisa.
  • A correlação exige montagem. Ligar métrica, trace e log é possível, mas depende de configuração e de padrão de instrumentação bem definido. Não vem pronto da mesma forma que numa plataforma única.
  • Disciplina de rótulos e consultas. Métricas com rótulos demais e logs sem estrutura degradam o desempenho e a utilidade da pilha. Isso cobra método de quem opera.

A versão gerenciada reduz bastante o primeiro ponto, e por isso costuma ser o meio-termo mais interessante para empresas que querem padrão aberto sem montar equipe de plataforma.

Volume de dados, retenção e amostragem: o que controla a conta

Seja qual for a escolha, a conta de observabilidade é controlada por três alavancas.

Volume ingerido. O maior vilão costuma ser log: depuração ligada em produção, corpo inteiro de cada requisição gravado, a mesma mensagem repetida em cada camada. Defina níveis de log por ambiente e revise o que é útil para investigar um incidente.

Retenção. Nem todo dado precisa ficar guardado pelo mesmo tempo. Métricas agregadas podem ficar muito tempo; logs detalhados raramente precisam. Separe também o que é exigência de auditoria, que pode ir para armazenamento mais barato, do que é dado de investigação do dia a dia.

Amostragem. Em sistemas com muito tráfego, guardar o trace de toda requisição é caro e pouco útil. A amostragem guarda uma parte das requisições normais e, idealmente, todas as que deram erro ou foram lentas. Configurar isso bem é uma das decisões que mais pesam no custo, nas duas abordagens.

Cardinalidade, em linguagem simples

Uma métrica com rótulo "filial" tem uma série por filial. Se alguém usa "código do cliente" como rótulo, passa a ter uma série por cliente. Isso é alta cardinalidade, causa comum de conta alta em plataforma SaaS e de lentidão em Prometheus auto-hospedado. A regra prática: identificadores únicos vão para log ou trace, não para rótulo de métrica.

Esse cuidado com volume faz parte de uma conversa maior sobre custo de infraestrutura, que tratamos em como reduzir a conta de nuvem sem perder estabilidade.

Alertas que funcionam: plantão, ruído e integração com o time

Sem alerta bem feito, a ferramenta é só um painel que ninguém olha de madrugada. E alerta mal feito é pior: acorda a pessoa errada pelo motivo errado até todos passarem a ignorar.

Alguns princípios valem para qualquer ferramenta:

  • Alerte sobre sintoma, não sobre causa. "Taxa de erro no checkout acima do normal" importa ao negócio. "CPU alta num servidor" pode não importar nada se o sistema está respondendo bem.
  • Todo alerta precisa de uma ação. Se a resposta a um alerta é "ok, pode ignorar", ele deve ser removido ou ajustado.
  • Defina severidade. O que acorda alguém de madrugada é diferente do que vira chamado para o dia seguinte.
  • Integre com o canal certo. As três opções se integram com ferramentas de mensagem e de gestão de plantão. O que importa é a escala de plantão estar definida e alguém ser responsável por responder.

Essa disciplina está ligada ao nível de serviço que a empresa promete ou exige do fornecedor. Se você está negociando suporte de um sistema crítico, veja o que exigir num SLA de sustentação de software. E se a meta é que o sistema não pare, monitoramento é só uma parte do desenho: as outras estão em alta disponibilidade de sistemas.

Tabela comparativa: Datadog x New Relic x Grafana

A tabela resume tendências gerais de cada modelo. Confirme com cada fornecedor como os recursos e a cobrança funcionam hoje para o seu caso.

Critério Datadog New Relic Pilha Grafana (Prometheus, Loki, Tempo)
Modelo Plataforma SaaS completa Plataforma SaaS completa Código aberto, auto-hospedado ou gerenciado
Tempo para começar Curto Curto Curto na versão gerenciada; maior na auto-hospedada
Correlação entre logs, métricas e traces Pronta na plataforma Pronta na plataforma Possível, depende de configuração
Onde o dado fica Na nuvem do fornecedor Na nuvem do fornecedor Onde você escolher, na versão auto-hospedada
Controle de retenção Dentro das opções do fornecedor Dentro das opções do fornecedor Amplo, definido por você
O que faz a conta crescer Volume ingerido e escopo monitorado Volume ingerido e usuários, conforme o modelo vigente Infraestrutura e horas de operação (auto-hospedada) ou volume (gerenciada)
Quem precisa operar Pouca operação da ferramenta Pouca operação da ferramenta Alguém com tempo e método, sobretudo na auto-hospedada
Custo de troca futura Maior se a instrumentação for proprietária Maior se a instrumentação for proprietária Menor, por usar padrões abertos
Perfil que costuma servir melhor Equipe enxuta, muitos serviços, pressa Equipe enxuta que quer plataforma única Empresa com exigência sobre o dado ou volume alto e alguém para operar

Quando escolher cada um

Sinais de que Datadog ou New Relic é o melhor caminho

  • A equipe de tecnologia é pequena e não tem ninguém para cuidar de uma ferramenta de monitoramento como se fosse um sistema.
  • Você precisa de resultado em semanas, não em meses, porque os incidentes já estão custando caro em operação parada.
  • O sistema tem vários serviços, integrações e filas, e a correlação pronta economiza horas em cada investigação.
  • Não há restrição contratual ou regulatória sobre logs ficarem na nuvem de um fornecedor.
  • Alguém vai ser dono do volume de dados e revisar a fatura todo mês.

Nesse cenário, montar uma pilha própria seria gastar engenharia num problema já resolvido no mercado. Assinar é a decisão certa.

Sinais de que a pilha Grafana é o melhor caminho

  • Há exigência de manter logs e métricas numa região ou infraestrutura específica.
  • O volume de dados é alto e previsível, e controlar retenção e armazenamento faz diferença real no custo.
  • A empresa já usa Prometheus, Kubernetes ou outras ferramentas abertas, e o time conhece esse ecossistema.
  • Existe alguém, interno ou parceiro, com tempo e método para operar e evoluir a pilha.

Se a operação da pilha for o problema, comece pela versão gerenciada. Ela mantém os padrões abertos e tira o peso de manter servidores de monitoramento.

Quando a resposta é "nenhum dos dois ainda"

Se o sistema não tem log estruturado, não tem um endpoint de saúde e ninguém sabe dizer quais são os três fluxos mais críticos do negócio, comprar ferramenta não resolve. O primeiro passo é instrumentar o básico e definir o que precisa ser monitorado. Qualquer uma das três opções vai funcionar melhor depois disso.

Perguntas frequentes

Qual a diferença entre monitoramento e observabilidade?

Monitoramento diz que algo está errado, como sistema fora do ar ou lento. Observabilidade permite descobrir por quê, correlacionando métricas, logs e traces de uma mesma requisição até achar o gargalo no banco, numa integração ou na fila. Na prática, uma boa ferramenta de observabilidade cobre os dois, desde que o sistema esteja bem instrumentado.

O Grafana é gratuito?

O Grafana é software de código aberto, e a versão auto-hospedada não cobra licença, mas não sai de graça: a empresa paga a infraestrutura onde Prometheus, Loki e Tempo rodam e as horas de quem opera a pilha. Na versão gerenciada pela Grafana Labs, a cobrança acompanha o volume de dados. Confirme o modelo vigente com o fornecedor.

O que é OpenTelemetry?

OpenTelemetry é um padrão aberto para instrumentar sistemas e gerar logs, métricas e traces de forma independente da ferramenta que vai recebê-los. Instrumentar com OpenTelemetry permite enviar os dados para Datadog, New Relic ou a pilha Grafana e reduz o custo de trocar de ferramenta no futuro, porque a instrumentação não precisa ser refeita.

Como evitar que a conta do Datadog ou do New Relic dispare?

A conta de Datadog ou New Relic é controlada por três alavancas: volume ingerido, retenção e amostragem. Reduzir logs de depuração em produção, guardar logs detalhados por menos tempo, amostrar traces de requisições normais e evitar rótulos de alta cardinalidade nas métricas fazem diferença real. Alguém precisa ser dono do volume e revisar a fatura todo mês.

Empresa pequena precisa de ferramenta de observabilidade?

Depende do estágio. Se o sistema ainda não tem log estruturado, endpoint de saúde nem fluxos críticos definidos, comprar uma ferramenta de observabilidade não resolve; o primeiro passo é instrumentar o básico. Depois disso, mesmo uma empresa pequena ganha com alertas que avisam sobre a queda do sistema antes que o cliente reclame.

Como a Pervian Tech ajuda a decidir e a montar o monitoramento

Começamos pela pergunta que guia este texto: o que precisa ser respondido quando o sistema cai. A partir dos fluxos críticos do negócio, do tamanho da equipe e das exigências sobre o dado, fazemos um diagnóstico inicial gratuito e recomendamos o caminho. Quando uma plataforma pronta atende, recomendamos a plataforma e ajudamos a instrumentar, controlar volume e montar alertas úteis. Quando o caso pede controle maior, montamos a pilha aberta, gerenciada ou auto-hospedada, com retenção, amostragem e plantão bem definidos.

Em qualquer caminho, instrumentamos com padrões abertos sempre que possível, para a empresa não ficar presa à decisão. Esse trabalho faz parte do nosso serviço de cloud e DevOps, e outros textos sobre o tema estão em cloud e infraestrutura. O investimento é definido sob consulta, depois de entender o sistema e a operação.

Se a última queda do seu sistema foi descoberta por um cliente, e não por um alerta, conte para nós como é hoje.

ObservabilidadeMonitoramentoCloudDevOpsServiço: Cloud & DevOps

Quer uma solução assim na sua empresa?

Cada projeto é desenhado sob medida para o seu processo, e o investimento é definido sob consulta depois de entendermos o contexto. O diagnóstico inicial não tem custo: descreva o cenário e respondemos em até um dia útil.

Falar com a Pervian Tech

Continue lendo

Fale conosco

Conte o problema que precisa resolver

Respondemos em até um dia útil com uma avaliação técnica inicial. Sem custo e sem compromisso.

Usamos seus dados apenas para responder este contato.