Appendix A — CDI Data Acquisition System Overview

Published

Jun 2026

  • ID: DAS-APP
  • Type: Appendix
  • Audience: Omics Data Scientists, Bioinformaticians, and Research Teams
  • Theme: CDI Data Acquisition System Reference Materials

The CDI Data Acquisition System consists of a series of interconnected systems that transform public omics data into reusable reference datasets.

Study Discovery
        ↓
Metadata Acquisition
        ↓
Data Download
        ↓
Data Validation
        ↓
Cloud Storage and Transfer
        ↓
Reference Dataset Assembly
        ↓
Reusable Reference Dataset

Repository Accession Reference

Common accession types encountered during data acquisition:

Resource Example
BioProject PRJNA322554
BioSample SAMN12345678
SRA Run SRR12345678
GEO Series GSE123456
ENA Study ERP123456

Example Validation Projects

The CDI Data Acquisition System was validated using two representative human gut microbiome BioProjects.

BioProject Sequencing Layout Platform
PRJNA322554 Single-end amplicon sequencing 454 GS FLX Titanium
PRJNA802976 Paired-end amplicon sequencing Illumina MiSeq

Together these projects demonstrate metadata acquisition, download, validation, and dataset assembly workflows across multiple sequencing designs.

Directory Structure Reference

Example CDI Data Acquisition System project structure:

project/
├── data/
│   ├── metadata/
│   ├── manifests/
│   ├── inventory/
│   ├── raw/
│   └── validation/
│
├── scripts/
│   └── bash/
│
├── library/
├── docs/
└── environment.yml

Bash Scripts Reference

The following scripts are developed throughout this guide.

scripts/bash/
├── 04a-download-ncbi-runinfo.sh
├── 04b-download-ena-metadata.sh
│
├── 05a-build-download-manifest.sh
├── 05b-download-ena-fastq.sh
├── 05c-download-ncbi-sra.sh
├── 05d-verify-downloads.sh
├── 05e-build-fastq-inventory.sh
│
├── 06-validate-downloads.sh
│
└── 07a-sync-to-s3.sh

Common Repository Tools

Metadata Acquisition

EDirect
pysradb
curl
wget

Data Download

SRA Toolkit
wget
curl
pigz

Validation

gzip
seqkit
csvtk
jq

Cloud Storage

AWS CLI
rsync
Aspera

Conda Environment

Example environment:

conda env create -f environment.yml

conda activate cdi-data-acquisition

Core tools used throughout the CDI Data Acquisition System include:

entrez-direct
pysradb
sra-tools
wget
curl
seqkit
csvtk
jq
parallel
pigz

Key Principles

The CDI Data Acquisition System is built upon the following principles:

  • Reproducibility
  • Transparency
  • Metadata-first design
  • Validation before analysis
  • Provenance preservation
  • Cloud-ready workflows
  • Reusable reference datasets

Bibliography and Resources

The references cited throughout this guide are maintained in the bibliography database (library/references.bib) and are included automatically during book generation.

This appendix also provides a quick reference to commonly cited resources and repositories used throughout the CDI Data Acquisition System.

Suggested Citation Keys

The following citation keys are commonly used throughout the CDI Data Acquisition System:

Major Public Data Resources