Name: Imaging Data Commons
Author: Org-GAgent

Skills suchen.../

Imaging Data Commons | Skills Pool

Identifier	Scope	Use for
`collection_id`	Dataset grouping	Filtering by project/study
`PatientID`	Patient	Grouping images by patient
`StudyInstanceUID`	DICOM study	Grouping of related series, visualization
`SeriesInstanceUID`	DICOM series	Grouping of related series, visualization

Table	Row Granularity	Loaded	Description
`index`	1 row = 1 DICOM series	Auto	Primary metadata for all current IDC data
`prior_versions_index`	1 row = 1 DICOM series	Auto	Series from previous IDC releases; for downloading deprecated data
`collections_index`	1 row = 1 collection	fetch_index()	Collection-level metadata and descriptions
`analysis_results_index`	1 row = 1 analysis result collection	fetch_index()	Metadata about derived datasets (annotations, segmentations)
`clinical_index`	1 row = 1 clinical data column	fetch_index()	Dictionary mapping clinical table columns to collections
`sm_index`	1 row = 1 slide microscopy series	fetch_index()	Slide Microscopy (pathology) series metadata
`sm_instance_index`	1 row = 1 slide microscopy instance	fetch_index()	Instance-level (SOPInstanceUID) metadata for slide microscopy
`seg_index`	1 row = 1 DICOM Segmentation series	fetch_index()	Segmentation metadata: algorithm, segment count, reference to source image series

Join Column	Tables	Use Case
`collection_id`	index, prior_versions_index, collections_index, clinical_index	Link series to collection metadata or clinical data
`SeriesInstanceUID`	index, prior_versions_index, sm_index, sm_instance_index	Link series across tables; connect to slide microscopy details
`StudyInstanceUID`	index, prior_versions_index	Link studies across current and historical data
`PatientID`	index, prior_versions_index	Link patients across current and historical data
`analysis_result_id`	index, analysis_results_index	Link series to analysis result metadata (annotations, segmentations)
`source_DOI`	index, analysis_results_index	Link by publication DOI
`crdc_series_uuid`	index, prior_versions_index	Link by CRDC unique identifier
`Modality`	index, prior_versions_index	Filter by imaging modality
`SeriesInstanceUID`	index, seg_index	Link segmentation series to its index metadata
`segmented_SeriesInstanceUID`	seg_index → index	Link segmentation to its source image series (join seg_index.segmented_SeriesInstanceUID = index.SeriesInstanceUID)

from idc_index import IDCClient
client = IDCClient()

# Join index with collections_index to get cancer types
client.fetch_index("collections_index")
result = client.sql_query("""
    SELECT i.SeriesInstanceUID, i.Modality, c.CancerTypes, c.TumorLocations
    FROM index i
    JOIN collections_index c ON i.collection_id = c.collection_id
    WHERE i.Modality = 'MR'
    LIMIT 10
""")

# Join index with sm_index for slide microscopy details
client.fetch_index("sm_index")
result = client.sql_query("""
    SELECT i.collection_id, i.PatientID, s.ObjectiveLensPower, s.min_PixelSpacing_2sf
    FROM index i
    JOIN sm_index s ON i.SeriesInstanceUID = s.SeriesInstanceUID
    LIMIT 10
""")

# Join seg_index with index to find segmentations and their source images
client.fetch_index("seg_index")
result = client.sql_query("""
    SELECT
        s.SeriesInstanceUID as seg_series,
        s.AlgorithmName,
        s.total_segments,
        src.collection_id,
        src.Modality as source_modality,
        src.BodyPartExamined
    FROM seg_index s
    JOIN index src ON s.segmented_SeriesInstanceUID = src.SeriesInstanceUID
    WHERE s.AlgorithmType = 'AUTOMATIC'
    LIMIT 10
""")

from idc_index import IDCClient
client = IDCClient()

# Query the primary index (always available)
results = client.sql_query("SELECT * FROM index WHERE Modality = 'CT' LIMIT 10")

# Fetch and query additional indices
client.fetch_index("collections_index")
collections = client.sql_query("SELECT collection_id, CancerTypes, TumorLocations FROM collections_index")

client.fetch_index("analysis_results_index")
analysis = client.sql_query("SELECT * FROM analysis_results_index LIMIT 5")

# Primary index (always available after client initialization)
df = client.index

# Fetch and access on-demand indices
client.fetch_index("sm_index")
sm_df = client.sm_index

from idc_index import IDCClient
client = IDCClient()

# List all available indices with descriptions
for name, info in client.indices_overview.items():
    print(f"\n{name}:")
    print(f"  Installed: {info['installed']}")
    print(f"  Description: {info['description']}")

# Get complete schema for a specific index (columns, types, descriptions)
schema = client.indices_overview["index"]["schema"]
print(f"\nTable: {schema['table_description']}")
print("\nColumns:")
for col in schema['columns']:
    desc = col.get('description', 'No description')
    # Description indicates if column is from DICOM attribute
    print(f"  {col['name']} ({col['type']}): {desc}")

# Find columns that are DICOM attributes (check description for "DICOM" reference)
dicom_cols = [c['name'] for c in schema['columns'] if 'DICOM' in c.get('description', '').upper()]
print(f"\nDICOM-sourced columns: {dicom_cols}")

schema = client.get_index_schema("index")
# Returns same schema dict: {'table_description': ..., 'columns': [...]}

Column	Type	DICOM	Description
`collection_id`	STRING	No	IDC collection identifier
`analysis_result_id`	STRING	No	If applicable, indicates what analysis results collection given series is part of
`source_DOI`	STRING	No	DOI linking to dataset details; use for learning more about the content and for attribution (see citations below)
`PatientID`	STRING	Yes	Patient identifier
`StudyInstanceUID`	STRING	Yes	DICOM Study UID
`SeriesInstanceUID`	STRING	Yes	DICOM Series UID — use for downloads/viewing
`Modality`	STRING	Yes	Imaging modality (CT, MR, PT, SM, etc.)
`BodyPartExamined`	STRING	Yes	Anatomical region
`SeriesDescription`	STRING	Yes	Description of the series
`Manufacturer`	STRING	Yes	Equipment manufacturer
`StudyDate`	STRING	Yes	Date study was performed
`PatientSex`	STRING	Yes	Patient sex
`PatientAge`	STRING	Yes	Patient age at time of study
`license_short_name`	STRING	No	License type (CC BY 4.0, CC BY-NC 4.0, etc.)
`series_size_MB`	FLOAT	No	Size of series in megabytes
`instanceCount`	INTEGER	No	Number of DICOM instances in series

# Fetch clinical index (also downloads clinical data tables)
client.fetch_index("clinical_index")

# Query clinical index to find available tables and their columns
tables = client.sql_query("SELECT DISTINCT table_name, column_label FROM clinical_index")

# Load a specific clinical table as DataFrame
clinical_df = client.get_clinical_table("table_name")

Method	Auth Required	Best For
`idc-index`	No	Key queries and downloads (recommended)
IDC Portal	No	Interactive exploration, manual selection, browser-based download
BigQuery	Yes (GCP account)	Complex queries, full DICOM metadata
DICOMweb proxy	No	Tool integration via DICOMweb API
Cloud storage (S3/GCS)	No	Direct file access, bulk downloads, custom pipelines

Bucket (AWS / GCS)	License	Content
`idc-open-data` / `idc-open-data`	No commercial restriction	>90% of IDC data
`idc-open-data-two` / `idc-open-idc1`	No commercial restriction	Collections with potential head scans
`idc-open-data-cr` / `idc-open-cr`	Commercial use restricted (CC BY-NC)	~4% of data

pip install --upgrade idc-index

pip install pandas numpy pydicom

from idc_index import IDCClient

client = IDCClient()

# Get summary statistics from primary index
query = """
SELECT
  collection_id,
  COUNT(DISTINCT PatientID) as patients,
  COUNT(DISTINCT SeriesInstanceUID) as series,
  SUM(series_size_MB) as size_mb
FROM index
GROUP BY collection_id
ORDER BY patients DESC
"""
collections_summary = client.sql_query(query)

# For richer collection metadata, use collections_index
client.fetch_index("collections_index")
collections_info = client.sql_query("""
    SELECT collection_id, CancerTypes, TumorLocations, Species, Subjects, SupportingData
    FROM collections_index
""")

# For analysis results (annotations, segmentations), use analysis_results_index
client.fetch_index("analysis_results_index")
analysis_info = client.sql_query("""
    SELECT analysis_result_id, analysis_result_title, Subjects, Collections, Modalities
    FROM analysis_results_index
""")

from idc_index import IDCClient

client = IDCClient()

# Check what Modality values exist
modalities = client.sql_query("""
    SELECT DISTINCT Modality, COUNT(*) as series_count
    FROM index
    GROUP BY Modality
    ORDER BY series_count DESC
""")
print(modalities)

# Check what BodyPartExamined values exist for MR modality
body_parts = client.sql_query("""
    SELECT DISTINCT BodyPartExamined, COUNT(*) as series_count
    FROM index
    WHERE Modality = 'MR' AND BodyPartExamined IS NOT NULL
    GROUP BY BodyPartExamined
    ORDER BY series_count DESC
    LIMIT 20
""")
print(body_parts)

# Find breast MRI scans (use actual values from exploration above)
results = client.sql_query("""
    SELECT
      collection_id,
      PatientID,
      SeriesInstanceUID,
      Modality,
      SeriesDescription,
      license_short_name
    FROM index
    WHERE Modality = 'MR'
      AND BodyPartExamined = 'BREAST'
    LIMIT 20
""")

# Access results as pandas DataFrame
for idx, row in results.iterrows():
    print(f"Patient: {row['PatientID']}, Series: {row['SeriesInstanceUID']}")

client.fetch_index("collections_index")
results = client.sql_query("""
    SELECT i.collection_id, i.PatientID, i.SeriesInstanceUID, i.Modality
    FROM index i
    JOIN collections_index c ON i.collection_id = c.collection_id
    WHERE c.CancerTypes LIKE '%Breast%'
      AND i.Modality = 'MR'
    LIMIT 20
""")

from idc_index import IDCClient

client = IDCClient()

# Download small collection (RIDER Pilot ~1GB)
client.download_from_selection(
    collection_id="rider_pilot",
    downloadDir="./data/rider"
)

# First, query for series UIDs
series_df = client.sql_query("""
    SELECT SeriesInstanceUID
    FROM index
    WHERE Modality = 'CT'
      AND BodyPartExamined = 'CHEST'
      AND collection_id = 'nlst'
    LIMIT 5
""")

# Download only those series
client.download_from_selection(
    seriesInstanceUID=list(series_df['SeriesInstanceUID'].values),
    downloadDir="./data/lung_ct"
)

# Simplified hierarchy (omit StudyInstanceUID level)
client.download_from_selection(
    collection_id="tcga_luad",
    downloadDir="./data",
    dirTemplate="%collection_id/%PatientID/%Modality"
)
# Results in: ./data/tcga_luad/TCGA-05-4244/CT/

# Flat structure (all files in one directory)
client.download_from_selection(
    seriesInstanceUID=list(series_df['SeriesInstanceUID'].values),
    downloadDir="./data/flat",
    dirTemplate=""
)
# Results in: ./data/flat/*.dcm

# Download entire collection
idc download rider_pilot --download-dir ./data

# Download specific series by UID
idc download "1.3.6.1.4.1.9328.50.1.69736" --download-dir ./data

# Download multiple items (comma-separated)
idc download "tcga_luad,tcga_lusc" --download-dir ./data

# Download from manifest file (auto-detected)
idc download manifest.txt --download-dir ./data

Option	Description
`--download-dir`	Output directory (default: current directory)
`--dir-template`	Directory hierarchy template (default: `%collection_id/%PatientID/%StudyInstanceUID/%Modality_%SeriesInstanceUID`)
`--log-level`	Verbosity: debug, info, warning, error, critical

Endpoint	Auth	Use Case
Public proxy	No	Testing, moderate queries, daily quota
Google Healthcare	Yes (GCP)	Production use, higher quotas

Imaging Data Commons

Overview

Imaging Data Commons

Overview

When to Use This Skill

IDC Data Model

Index Tables

Available Tables

Joining Tables

Accessing Index Tables

Discovering Table Schemas (Essential for Query Writing)

Key Columns in Primary `index` Table

Clinical Data Access

Data Access Options

Installation and Setup

Core Capabilities

1. Data Discovery and Exploration

2. Querying Metadata with SQL

3. Downloading DICOM Files

Command-Line Download

Healthcare Cdss Patterns

Drug Discovery

Qmd

Attack Tree Construction

Azure Ai Anomalydetector Java

Viboscope

Imaging Data Commons

Overview

Imaging Data Commons

Overview

When to Use This Skill

IDC Data Model

Index Tables

Available Tables

Joining Tables

Accessing Index Tables

Discovering Table Schemas (Essential for Query Writing)

Key Columns in Primary index Table

Clinical Data Access

Data Access Options

Installation and Setup

Core Capabilities

1. Data Discovery and Exploration

2. Querying Metadata with SQL

3. Downloading DICOM Files

Command-Line Download

Healthcare Cdss Patterns

Drug Discovery

Qmd

Attack Tree Construction

Azure Ai Anomalydetector Java

Viboscope

Key Columns in Primary `index` Table