Appendix A — CDI Data Acquisition System Overview
The CDI Data Acquisition System consists of a series of interconnected systems that transform public omics data into reusable reference datasets.
Study Discovery
↓
Metadata Acquisition
↓
Data Download
↓
Data Validation
↓
Cloud Storage and Transfer
↓
Reference Dataset Assembly
↓
Reusable Reference Dataset
Repository Accession Reference
Common accession types encountered during data acquisition:
| Resource | Example |
|---|---|
| BioProject | PRJNA322554 |
| BioSample | SAMN12345678 |
| SRA Run | SRR12345678 |
| GEO Series | GSE123456 |
| ENA Study | ERP123456 |
Example Validation Projects
The CDI Data Acquisition System was validated using two representative human gut microbiome BioProjects.
| BioProject | Sequencing Layout | Platform |
|---|---|---|
| PRJNA322554 | Single-end amplicon sequencing | 454 GS FLX Titanium |
| PRJNA802976 | Paired-end amplicon sequencing | Illumina MiSeq |
Together these projects demonstrate metadata acquisition, download, validation, and dataset assembly workflows across multiple sequencing designs.
Directory Structure Reference
Example CDI Data Acquisition System project structure:
project/
├── data/
│ ├── metadata/
│ ├── manifests/
│ ├── inventory/
│ ├── raw/
│ └── validation/
│
├── scripts/
│ └── bash/
│
├── library/
├── docs/
└── environment.yml
Bash Scripts Reference
The following scripts are developed throughout this guide.
scripts/bash/
├── 04a-download-ncbi-runinfo.sh
├── 04b-download-ena-metadata.sh
│
├── 05a-build-download-manifest.sh
├── 05b-download-ena-fastq.sh
├── 05c-download-ncbi-sra.sh
├── 05d-verify-downloads.sh
├── 05e-build-fastq-inventory.sh
│
├── 06-validate-downloads.sh
│
└── 07a-sync-to-s3.sh
Common Repository Tools
Metadata Acquisition
EDirect
pysradb
curl
wget
Data Download
SRA Toolkit
wget
curl
pigz
Validation
gzip
seqkit
csvtk
jq
Cloud Storage
AWS CLI
rsync
Aspera
Conda Environment
Example environment:
conda env create -f environment.yml
conda activate cdi-data-acquisitionCore tools used throughout the CDI Data Acquisition System include:
entrez-direct
pysradb
sra-tools
wget
curl
seqkit
csvtk
jq
parallel
pigz
Recommended Workflow
Research Question
↓
Study Discovery
↓
Metadata Acquisition
↓
Metadata Review
↓
Data Download
↓
Data Validation
↓
Cloud Storage
↓
Reference Dataset Assembly
↓
Dataset Release
Key Principles
The CDI Data Acquisition System is built upon the following principles:
- Reproducibility
- Transparency
- Metadata-first design
- Validation before analysis
- Provenance preservation
- Cloud-ready workflows
- Reusable reference datasets
Bibliography and Resources
The references cited throughout this guide are maintained in the bibliography database (library/references.bib) and are included automatically during book generation.
This appendix also provides a quick reference to commonly cited resources and repositories used throughout the CDI Data Acquisition System.
Suggested Citation Keys
The following citation keys are commonly used throughout the CDI Data Acquisition System:
Major Public Data Resources
- NCBI — https://www.ncbi.nlm.nih.gov (National Center for Biotechnology Information 2026d)
- Sequence Read Archive (SRA) — https://www.ncbi.nlm.nih.gov/sra (National Center for Biotechnology Information 2026e)
- BioProject — https://www.ncbi.nlm.nih.gov/bioproject (National Center for Biotechnology Information 2026a)
- BioSample — https://www.ncbi.nlm.nih.gov/biosample (National Center for Biotechnology Information 2026b)
- Gene Expression Omnibus (GEO) — https://www.ncbi.nlm.nih.gov/geo (National Center for Biotechnology Information 2026c)
- European Nucleotide Archive (ENA) — https://www.ebi.ac.uk/ena (European Nucleotide Archive 2026)
- MGnify — https://www.ebi.ac.uk/metagenomics (European Bioinformatics Institute 2026b)
- GWAS Catalog — https://www.ebi.ac.uk/gwas (European Bioinformatics Institute 2026a)
- DNA Data Bank of Japan (DDBJ) — https://www.ddbj.nig.ac.jp (DNA Data Bank of Japan 2026)