dbt, voor alles binnen je warehouse. Omdat je modellen naar elkaar verwijzen met ref(), kent dbt de afhankelijkheden zonder dat je ze opschrijft. dbt docs generate gevolgd door dbt docs serve geeft je een klikbare grafiek van bron tot mart. Met dbt ls --select stg_ga4__events+ krijg je op de commandline alles wat achter dat model hangt, wat handig is voordat je iets sloopt.
BigQuery, voor wat er buiten dbt gebeurt. De querygeschiedenis in INFORMATION_SCHEMA.JOBS laat zien welke tabellen door welke queries zijn gelezen, inclusief de queries die je BI-tool stuurt. De historie gaat een beperkte periode terug, dus gebruik het om te onderzoeken, niet om te archiveren.
SELECT
user_email,
COUNT(*) AS jobs,
MAX(creation_time) AS last_seen
FROM `region-eu`.INFORMATION_SCHEMA.JOBS,
UNNEST(referenced_tables) AS t
WHERE creation_time > TIMESTAMP_SUB(CURRENT_TIMESTAMP(), INTERVAL 30 DAY)
AND t.dataset_id = 'marts_marketing'
AND t.table_id = 'mart_channel_performance'
GROUP BY user_email
ORDER BY jobs DESC
In Google Cloud kun je daarnaast lineage voor BigQuery aanzetten via Dataplex, dat de relaties tussen tabellen automatisch vastlegt.
De laatste stap naar de site of app: je meetplan. Geen enkele tool kent het verband tussen de knop op je checkoutpagina en het event dat daaruit volgt. Dat staat in je tagging-documentatie, of het staat nergens.