Reduz o uso de memória na geração e exportação de métricas diárias - #138
Merged
pitangainnovare merged 9 commits intoSep 3, 2026
Merged
Conversation
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
O que esse PR faz?
Reduz o pico de memória da geração e da exportação das métricas diárias, especialmente para logs grandes da coleção SCL.
ijson, sem carregar o arquivo completo na memória;2.3.3.Não há alteração de mappings, métricas COUNTER, identificadores, payload canônico ou regras de deduplicação.
Onde a revisão poderia começar?
A revisão pode começar por
metrics/services/parsing/job_payloads.py, que coordena conversão, liberação de memória e serialização. Em seguida:metrics/services/daily_payloads.py: escrita e leitura incremental;metrics/services/export.py: exportação por granularidade;metrics/opensearch/client.py: lotes e compressão HTTP;metrics/counter/access/daily_accumulator.py: consumo progressivo do acumulador.Como este poderia ser testado manualmente?
Executar no Docker:
Resultados locais:
138 passed, 2 skipped;17 passed, 2 skipped;1da947e9db472e08292fcac3dbd0fd9b557efd653bf47bac6dd7a0e5cbf99bc1;6931,1 MiBpara5568,4 MiB, sem regressão relevante de tempo;1.381.500para13.946bytes.Algum cenário de contexto que queira dar?
O processamento de um log SCL com milhões de linhas chegou a pressionar o limite de memória do worker de HML. Embora o parsing já utilizasse registros compactos, a conversão, a serialização e a exportação ainda podiam manter estruturas mensais, anuais ou o payload completo simultaneamente na memória. Este PR torna essas etapas incrementais e retomáveis, reduzindo o risco de reinício do worker sem alterar os dados finais enviados ao OpenSearch.
Screenshots
Não aplicável. A alteração é interna ao pipeline de processamento.
Quais são os tickets relevantes?
Relacionado a #128.
Referências
ijson: https://github.com/ICRAR/ijsonSegurança da informação (NSI.04)
Este PR manipula dados sensíveis ou pessoais (LGPD)?
Este PR altera autenticação, autorização, controle de acesso ou gerenciamento de sessão?
Este PR introduz, atualiza ou remove dependências de terceiros?
ijson==3.5.1para leitura incremental dos payloads.Este PR foi validado pelo pipeline de segurança (SonarQube / Trivy)?
Este PR concatena, monta ou executa comandos SQL, HTML ou JavaScript a partir de entrada externa?
Este PR expõe novos endpoints, telas ou serviços?
Algum segredo, senha, chave ou token está sendo adicionado ao código-fonte?