DataSentry Data Quality Report

report_schema_version: 1.0 · datasentry_version: 0.1.0 · scan_run_id: scan_3426008c0380 · generated_at: 2026-08-09T12:29:19.607681+00:00 · reproducible: True · llm_used: False

Executive Summary

Overall94.6
Issues15
Detector runs39
Rows / Columns200 / 7

Quality Score

Overall: 94.6 (score_version 1)

completeness 99.7
validity 96.2
uniqueness 85.5
consistency: n/a
integrity: n/a
timeliness: n/a

dimension = 100 * (1 - sum(weight_issue * severity_norm * affected_ratio) / (n * 1.6)); severity_norm = SEVERITY_WEIGHTS (ADR-003); field criticality = NORMAL default (contract V1); coverage adjust = 1.0 (V1); weights renormalized across scored dimensions

Per-issue deductions (hover the score bar):

Issue Breakdown

SeverityPriorityTitleColumnsDetectorsAffected
low81.5String format issue in emailemailleading_or_trailing_whitespace, repeated_whitespace, invalid_email11 (0.0550)
medium76.5Numeric outlier in totaltotaliqr_outlier, percentile_outlier, modified_zscore, tail_probability5 (0.0250)
medium73.5Duplicate values in statusstatusuniqueness_violation195 (0.9750)
medium73.5Duplicate values in quantityquantityuniqueness_violation190 (0.9500)
medium73.5Duplicate values in totaltotaluniqueness_violation60 (0.3000)
medium73.5Duplicate values in event_dateevent_dateuniqueness_violation24 (0.1200)
high72.4Datetime anomaly in event_dateevent_dateinvalid_date, impossible_date4 (0.0200)
medium69.0Numeric outlier in quantityquantitymodified_zscore21 (0.1050)
low69.0String format issue in customercustomerleading_or_trailing_whitespace, repeated_whitespace5 (0.0250)
low66.5Categorical anomaly in customercustomercategory_explosion200 (1.0000)
low66.5Categorical anomaly in emailemailcategory_explosion195 (0.9750)
medium66.0Duplicate values in emailemailuniqueness_violation5 (0.0250)
low60.0Missing values in event_dateevent_datesuspicious_missing_token4 (0.0200)
medium59.5Numeric outlier in order_idorder_idpercentile_outlier2 (0.0100)
low55.0Distribution anomaly in order_idorder_idmodel_outlier4 (0.0200)

Critical Findings

Dataset Overview

dataset_idorders
statuscompleted
rows200
schema_hash64ff9e1cc2c6058dd12b3cf6c83e40af95bd3bb304cb809774cbde6f0dda0151

Columns:

Methodology

Deterministic SQL pushdown detectors (15 in MVP) run per column; candidates are fused per issue cluster (confidence = 1 - prod(1 - c_i)); each issue receives a priority score (0-100, 12.8 formula); the quality score aggregates per dimension (27.1 formula, ADR-013). No LLM calls in MVP: scores are fully reproducible.

Reproducibility Metadata