КАРТОЧКА ПРОЕКТА ФУНДАМЕНТАЛЬНЫХ И ПОИСКОВЫХ НАУЧНЫХ ИССЛЕДОВАНИЙ,
ПОДДЕРЖАННОГО РОССИЙСКИМ НАУЧНЫМ ФОНДОМ

Информация подготовлена на основании данных из Информационно-аналитической системы РНФ, содержательная часть представлена в авторской редакции. Все права принадлежат авторам, использование или перепечатка материалов допустима только с предварительного согласия авторов.

 

ОБЩИЕ СВЕДЕНИЯ


Номер проекта 24-24-20108

НазваниеИсследование гетерогенности районов открытого хроматина на уровне клеточных субпопуляций на основании массового анализа single-cell ATAC-seq данных

Руководитель Колмыков Семён Константинович,

Организация финансирования, регион Автономная некоммерческая образовательная организация высшего образования "Научно-технологический Университет "СИРИУС" , Краснодарский край

Конкурс №90 - Конкурс 2024 года «Проведение фундаментальных научных исследований и поисковых научных исследований малыми отдельными научными группами» (региональный конкурс)

Область знания, основной код классификатора 04 - Биология и науки о жизни; 04-207 - Системная биология; биоинформатика

Ключевые слова Омиксные данные, scATAC-seq, регуляция транскрипции, открытый хроматин, база данных, GTRD, FANTOM5, BioUML, машинное обучение

Код ГРНТИ34.03.23


 

ИНФОРМАЦИЯ ИЗ ЗАЯВКИ


Аннотация
Современные методы высокопроизводительных исследований генерируют огромный массив информации по ключевым факторам регуляции транскрипции, в частности: ChIP-seq, ChIP-exo, DNase-seq, ATAC-seq, FAIRE-seq, MNase-seq, WGBS, CAGE-seq, RNA-seq, eQTL, GWAS, Hi-C. Однако данные недостаточно интегрированы друг с другом, что существенно затрудняет их совместное использование как для понимания механизмов регуляции транскрипции, так и для решения практических задач. Коллективом авторов данной заявки c 2012 года разрабатывается и поддерживается база данных GTRD (https://gtrd.biouml.org). На данный момент GTRD – крупнейшая в России база генетической информации и одна из крупнейших в мире база по регуляции транскрипции (500+ TB). В настоящий момент база данных включает в себя наиболее популярные дизайны экспериментов, основанные на использовании высокопроизводительного секвенирования: ChIP-seq, ChIP-exo, DNase-seq, ATAC-seq, FAIRE-seq, MNase-seq, WGBS, CAGE-seq и RNA-seq для 10 видов организмов: Homo sapiens, Mus musculus, Rattus norvegicus, Gallus gallus, Danio rerio, Caenorhabditis elegans, Drosophila melanogaster, Saccharomyces cerevisiae, Schizosaccharomyces pombe и Arabidopsis thaliana. База данных GTRD является крайне востребованной, широко используемой и цитируемой: 300+ цитирований по версии Semantic Scholar (https://www.semanticscholar.org/). На основе информации из базы данных GTRD было создано несколько достаточно широко известных и популярных международных баз данных: HOCOMOCO, ADASTRA, ANANASTRA, BaMM motif, mSigDB (Molecular Signatures DataBase) C3: regulatory target gene sets. Однако в базе данных GTRD отсутствуют набравшие за последние годы популярность эксперименты секвенирования отдельных клеток (single-cell, sc; Например, single-cell ATAC-seq). Посколько упаковка ДНК и белок-хроматиновые взаимодействия представляют собой комплексную динамическую структуру, можно говорить о наличии высоковариабельных районов открытого хроматина, которые плохо детектируются методами, основанными на секвенировании клеточных популяций, ввиду гетерогенности рассматриваемых образцов. Новые экспериментальные технологии позволяют получать данные о регуляции транскрипции для отдельно взятых клеток. Планируется интегрировать данные scATAC-seq в базу данных GTRD. Будет проведено сопоставление результатов по отдельным клеткам с имеющимися в GTRD данными по открытому хроматину, а также интеграция и совместный анализ имеющихся данных по регуляции транскрипции. Таким образом будут получены новые знания о клеточной специфичности регуляции транскрипции на уровне единичных клеток. В ходе проекта РНФ №20-74-10075 под рук. Кулаковского И. В. проводятся работы по аннотации аллель-специфичной доступности хроматина. В рамках развития нашего успешного партнерства с коллективом, мы объединим эти данные по аллель-специфичным сайтам с другими геномными разметками, представленными в нашей базе данных, что обогатит возможности исследователей по аннотации однонуклеотидных вариантов.


 

ОТЧЁТНЫЕ МАТЕРИАЛЫ


Аннотация результатов, полученных в 2024 году
В рамках данного проекта в 2024 году были проведены работы по анализу данных секвенирования одиночных клеток (single cell), направленных на исследование районов открытого хроматина (scATAC-seq). Были начаты работы по разработке нового подхода к импутации scATAC-seq данных, а также по интеграции имеющихся в базе данных (БД) GEO NCBI/SRA scATAC-seq данных в БД GTRD. За 2024 год было проаннотированно 1894 scATAC-seq эксперимента из БД GEO NCBI, охватывающих 7 организмов и 217 уникальных клеточных типов. Основные виды: человек (891 эксперимент) и мышь (877 экспериментов). Доработка программы для полуавтоматической аннотации, Geominer, позволила упростить добавление мета-информации и указания форматов хранения клеточных баркодов. На основании сопоставления с данными из БД GTRD cоздан референсный набор для импутации scATAC-seq, включающий 510 ATAC-seq и 193 DNase-seq эксперимента, соответствующих 65 и 38 уникальным клеточным типам, соответственно. На основе использования преобразования TF-IDF и байесовской неотрицательной матричной факторизации (BNMF) был разработан алгоритм импутации scATAC-seq данных. Данный алгоритм способен учитывать априорные вероятности из внешних источников (например, референсный набор данных из БД GTRD). Проведено сопоставление районов открытого хроматина между scATAC-seq и bulk-DNase-seq/ATAC-seq. Для клеточной линии HEK293T выявлена высокая корреляция воспроизводимости пиков в схожих bulk эспериментаз и среди топ-100 по глубине покрытия клеток в рамках одного single-cell эксперимента (коэффициент Пирсона: 0.64–0.68), что подчёркивает биологическую значимость выявленных паттернов. Был реализован сценарий обработки scATAC-seq данных для системы усправления вычислениями eGrid. На платформе BioUML была добавлена возможность визуализации scATAC-seq данных. Ключевой особенностью нового функционала является использование Jupyter-notebook. Благодаря данному подходу пользователю доступно внесение изменений в анализ scATAC-seq, а также объединение различных экспериментов для совместного анализа данных с привлечением дополнительных инструментов. Описанные выше данные доступны на сайте БД GTRD: http://gtrd.biouml.org.

 

Публикации

1. Колмыков С., Куляшов М., Соколова Т., Прасолов Д., Колпаков Ф. Exploring the Interplay Between Reproducibility of Open Chromatin Regions and Transcription Factor Functional Activity ЧЕТЫРНАДЦАТАЯ МЕЖДУНАРОДНАЯ МУЛЬТИКОНФЕРЕНЦИЯ "БИОИНФОРМАТИКА РЕГУЛЯЦИИ И СТРУКТУРЫ ГЕНОМОВ/СИСТЕМНАЯ БИОЛОГИЯ" Новосибирск, Россия, 05–10 августа 2024 года , ЧЕТЫРНАДЦАТАЯ МЕЖДУНАРОДНАЯ МУЛЬТИКОНФЕРЕНЦИЯ "БИОИНФОРМАТИКА РЕГУЛЯЦИИ И СТРУКТУРЫ ГЕНОМОВ/СИСТЕМНАЯ БИОЛОГИЯ" (BGRS/SB-2024). – 2024. – С. 127-129 (год публикации - 2024)
10.18699/bgrs2024-1.2-13


Аннотация результатов, полученных в 2025 году
В отчетном 2025 году коллективом исполнителей была выполнена работа по созданию наиболее полной и унифицированной коллекции данных по открытому хроматину единичных клеток (scATAC-seq), интегрированной в отечественную базу данных регуляции транскрипции GTRD. Был сформирован глобальный атлас scATAC-seq. Проведен поиск и процессинг экспериментальных данных из международных репозиториев GEO, SRA и ENCODE. Итоговая коллекция составила 4661 эксперимент, что существенно превышает показатели 2024 года (1894 эксперимента). Охват расширен на 7 видов организмов (H. sapiens, M. musculus, D. melanogaster, D. rerio, G. gallus, R. norvegicus, A. thaliana) Уникальность GTRD заключается не просто в агрегации scATAC-seq данных, а в их интеграции с уже существующими массивами данных: ChIP-seq (связывание ТФ с хроматином и данные о модификации гистонов) и ATAC-seq/Dnase-seq (районы открытого хроматина). Эта интеграция позволила по-новому взглянуть на проблему воспроизводимости результатов bulk-экспериментов. Как показано в нашем исследовании, при анализе тысяч bulk ATAC-seq и DNase-seq экспериментов наблюдается значительная вариабельность: около 48% выявленных районов открытого хроматина (РОХ) имеют низкую воспроизводимость между аналогичными экспериментами. Традиционно такие регионы отбрасывались как технический шум или артефакты. Однако сопоставление этих регионов с данными scATAC-seq выявило закономерность: воспроизводимость РОХ в bulk-данных положительно коррелирует с долей клеток, в которых этот регион открыт в single-cell данных. Это означает, что низковоспроизводимые регионы в bulk-экспериментах часто являются не шумом, а биологически значимыми регуляторными элементами, активными лишь в малых субпопуляциях клеток (например, стволовых клетках или клетках в специфической фазе цикла). Интеграционный анализ показал, что: 1. Часто детектируемые в схожих по условиям проведения экспериментам РОХ обогащены сайтами связывания факторов домашнего хозяйства и общих активаторов, таких как SP1, NRF1, SRF. Эти факторы поддерживают базовую структуру хроматина во большинстве клеток. 2. Редко детектируемые РОХ специфически обогащены сайтами связывания пионерных транскрипционных факторов, таких как FOXA1, GATA3, SPI1. Пионерные факторы обладают уникальной способностью открывать конденсированный хроматин, инициируя, например, программы клеточной дифференцировки. Их активность часто ограничена узкими временными окнами, что и создает эффект "шума" при усреднении в bulk-экспериментах. Для удобства работы с данными разработан и внедрен усовершенствованный веб-интерфейс, который обеспечивает интерактивный доступ к результатам анализа. Каждому эксперименту соответствует отдельная карточка, содержащая: 1. краткое описание и ссылки на исходные данные; 2. параметры эксперимента (тип ткани, платформа, число клеток и кластеров); 3. ссылки для скачивания обработанных файлов (fragment, peaks, BigWig); 4. кнопку для открытия данных в встроенном геномном браузере. Встроенный геномный браузер, был дополнен поддержкой визуализации данных секвенирования единичных клеток. Пользователь может визуализировать как общий для всех клеток профиль покрытия прочтениями (BigWig), так и профиль для отдельных кластеров клеток, а также накладывать на них другие типы данных; например, сайты связывания факторов транскрипции из ChIP-seq или участки открытого хроматина из DNase-seq/ATAC-seq данных. Одновременное отображение нескольких треков позволяет напрямую сравнивать сигналы различных типов экспериментов, выявлять совпадающие или специфические для отдельных клеточных подтипов участки хроматина. Для опытных пользователей реализована дополнительная возможность интерактивного анализа данных в среде Jupyter-notebook с предустановленным ядром R и пакетом ArchR. Это позволяет выполнять повторный анализ на тех же данных, которые использовались при создании ресурса. Дополнительно в рамках проекта был разработан усовершенствованный, биологически обоснованный подход к импутации single-cell ATAC-seq данных. На первом этапе маркерные гены выделялись по коэффициентам линейных моделей CellTypist, после чего для них определялись регуляторно значимые пики с помощью алгоритма Cicero. Такой отбор признаков задает информативное подмножество регуляторных регионов и снижает размерность матрицы «клетки–пики», что улучшает качество импутации и положительно влияет на точность последующей кластеризации. Разработанный подход был протестирован и интегрирован в опубликованный в 2023 году группой Юлии Медведевой бенчмарком SAPIEnS – комплексной системой оценки методов импутации scATAC-seq данных. Обновленная версия конвейера SAPIEnS, включающая предложенный этап предобработки, опубликована в открытом доступе и обеспечивает воспроизводимость полученных результатов. Таким образом, платформа GTRD позволяет пользователю проводить разложение bulk-сигналов: обнаружив пик связывания ТФ в ChIP-seq, исследователь может мгновенно проверить по трекам scATAC-seq, является ли это взаимодействие общим или специфичным для выбранной клеточной субпопуляции.