Find the shortcut. Learn the biology.
Automated quality control for genomic machine learning datasets: scores the biases, duplicates and data leakage a classifier could exploit before you train on it.
Searching test set test.csv against train set train.csv
Data Leakage:FailHow a flag is decided →
gb-qc v1.0.0 · run 2026-08-26 23:57:51

Basic Descriptive Statistics

Filename test.csv train.csv
Number of sequences 613 4904
Minimum length 70 70
Mean length 70.00 70.00
Maximum length 70 70

Every test sequence searched against the train set with MMseqs2, and scored on its best hit. Similarity is min(query coverage, target coverage) × percent identity: how much of the shorter sequence the alignment spans, times how much of that matches. The histogram is the distribution of those best hits.

The flag is the percentage of test sequences at or above the threshold: Pass at 0%, Warning below 2%, Fail at 2% or more. A test sequence that near-duplicates a training one is one the model has already seen, so the accuracy it earns there is not evidence. What to do about it →

The panel under the histogram lists those alignments, up to the first 100; every one of them, listed or not, is exported to mmseqs/mmseqs2_search_result.tsv beside this report. Its columns are:

Query (Q)
Identifier of the test sequence: seq_<i>_test, where i is its 0-based position in the input test file.
Target (T)
Identifier of the train sequence: seq_<i>_train, where i is its 0-based position in the input train file.
Q Cov.
Fraction of the query sequence covered by the alignment (0–1).
T Cov.
Fraction of the target sequence covered by the alignment (0–1).
% Identity
Percent identical aligned positions in the aligned region.
% Similarity
Similarity score used for leakage detection, calculated as min(Q Cov., T Cov.) × % Identity.
E-value
MMseqs2 E-value (lower is more "significant").
Alignment
Click “Show” to expand the alignment visualisation for a row.
Filename test.csv train.csv
Data Leakage (percentage) 6.04% 0.98%
Data Leakage (count) 37 48
Similarity Histogram
50 high-similarity alignments
Query (Q) Target (T) Q Cov. T Cov. % Identity % Similarity E-value Alignment
seq_288_test seq_4581_train 1.00 1.00 100.0 100.00 1.63e-35
seq_393_test seq_2399_train 1.00 1.00 100.0 100.00 1.63e-35
seq_79_test seq_3278_train 1.00 1.00 100.0 100.00 1.63e-35
seq_175_test seq_3846_train 1.00 1.00 100.0 100.00 1.63e-35
seq_229_test seq_274_train 1.00 1.00 100.0 100.00 1.63e-35
seq_71_test seq_2201_train 1.00 1.00 100.0 100.00 1.63e-35
seq_371_test seq_2157_train 1.00 1.00 100.0 100.00 1.63e-35
seq_328_test seq_3730_train 1.00 1.00 100.0 100.00 1.63e-35
seq_60_test seq_4592_train 1.00 1.00 100.0 100.00 1.63e-35
seq_498_test seq_2891_train 1.00 1.00 100.0 100.00 1.63e-35
seq_148_test seq_300_train 1.00 1.00 100.0 100.00 1.63e-35
seq_10_test seq_78_train 1.00 1.00 100.0 100.00 1.63e-35
seq_351_test seq_332_train 1.00 1.00 100.0 100.00 1.63e-35
seq_330_test seq_1734_train 1.00 1.00 100.0 100.00 1.63e-35
seq_454_test seq_593_train 1.00 1.00 100.0 100.00 1.63e-35
seq_197_test seq_138_train 1.00 1.00 100.0 100.00 1.63e-35
seq_526_test seq_77_train 0.99 0.99 100.0 98.60 7.98e-35
seq_200_test seq_1011_train 0.99 0.99 100.0 98.60 7.98e-35
seq_252_test seq_4833_train 0.99 0.99 100.0 98.60 7.98e-35
seq_556_test seq_485_train 0.99 0.99 100.0 98.60 7.98e-35
seq_451_test seq_4608_train 1.00 1.00 98.5 98.50 8.59e-34
seq_451_test seq_732_train 1.00 1.00 98.5 98.50 8.59e-34
seq_60_test seq_1973_train 1.00 1.00 98.5 98.50 8.59e-34
seq_545_test seq_1842_train 1.00 1.00 97.1 97.10 4.38e-32
seq_199_test seq_252_train 0.97 0.97 100.0 97.10 3.90e-34
seq_371_test seq_4426_train 0.99 0.99 97.1 95.74 2.09e-31
seq_371_test seq_663_train 0.99 0.99 97.1 95.74 2.09e-31
seq_254_test seq_3435_train 1.00 1.00 95.7 95.70 2.15e-30
seq_451_test seq_3714_train 1.00 1.00 95.7 95.70 2.15e-30
seq_405_test seq_3435_train 1.00 1.00 95.7 95.70 2.15e-30
seq_467_test seq_2572_train 0.96 0.96 100.0 95.70 1.89e-33
seq_254_test seq_2583_train 1.00 1.00 94.2 94.20 1.01e-28
seq_371_test seq_3886_train 1.00 1.00 94.2 94.20 1.01e-28
seq_503_test seq_3797_train 1.00 1.00 94.2 94.20 1.01e-28
seq_409_test seq_4551_train 1.00 1.00 92.8 92.80 4.56e-27
seq_612_test seq_633_train 1.00 1.00 92.8 92.80 4.56e-27
seq_260_test seq_1362_train 1.00 1.00 92.8 92.80 4.56e-27
seq_140_test seq_2349_train 0.93 0.93 98.4 91.41 2.15e-30
seq_503_test seq_574_train 0.99 0.99 92.7 91.40 2.06e-26
seq_569_test seq_3568_train 0.99 0.99 92.7 91.40 2.06e-26
seq_569_test seq_2463_train 0.99 0.99 92.7 91.40 2.06e-26
seq_202_test seq_3075_train 0.96 0.96 95.5 91.39 2.18e-28
seq_404_test seq_3130_train 0.97 0.97 94.1 91.37 2.14e-27
seq_271_test seq_625_train 1.00 1.00 90.0 90.00 7.96e-24
seq_254_test seq_3681_train 1.00 1.00 90.0 90.00 7.96e-24
seq_254_test seq_1769_train 1.00 1.00 90.0 90.00 7.96e-24
seq_254_test seq_286_train 1.00 1.00 90.0 90.00 7.96e-24
seq_307_test seq_685_train 1.00 1.00 90.0 90.00 7.96e-24
seq_405_test seq_2583_train 1.00 1.00 90.0 90.00 7.96e-24
seq_144_test seq_2405_train 1.00 1.00 90.0 90.00 7.96e-24