O databricks-sync é um script Python de sincronização batch que replica os bancos Postgres operacionais da organização (o domínio core e o domínio auth) para a camada bronze de um Lakehouse Databricks. A cada execução, ele introspecta o information_schema de cada Postgres de origem, recria as tabelas de destino no Databricks com CREATE OR REPLACE TABLE traduzindo os tipos de coluna do Postgres para SQL do Databricks, e insere os dados lidos via psycopg2 em lotes de 500 linhas com executemany. Não há API, servidor ou processo de longa duração aqui: é um job que roda do início ao fim e termina, disparado periodicamente por um workflow do GitHub Actions (.github/workflows/sync.yml), a cada 4 horas via cron ou manualmente via workflow_dispatch.
- ARCHITECTURE.md, fluxo de sincronização e árvore do repositório.
- RUNNING.md, como rodar o script localmente.
- Deployment, este repositório não segue o fluxo padrão de deploy via
Dockerfile+ Docker Hub + ArgoCD/GKE descrito no Deployment global da organização — não existeDockerfileaqui. A "publicação" é o próprio agendamento do workflowsync.yml, que roda o script direto no runner do GitHub Actions a cada 4 horas (cron: "0 */4 * * *") ou sob demanda viaworkflow_dispatch, sem etapa de build de imagem ou sincronização de cluster.
- .github/CONTRIBUTING.md, convenções de commit, branch e Pull Request.
- .github/CODEOWNERS, donos responsáveis por aprovar mudanças em cada caminho do repositório.
CODE_OF_CONDUCT.mdeSECURITY.md, {a confirmar, não encontrados neste repositório no momento da escrita}.