|
Как последовательности ДНК связываются друг с другом
|
|
|
|
Исследователи продемонстрировали новую модель ИИ, которая может предсказывать, какие молекулы ДНК связываются с другими молекулами ДНК. Более глубокое понимание этих гиперсложных взаимосвязей связывания может быть полезно в самых разных областях применения, от биомедицинской диагностики до ДНК-вычислений.
|
|
|
|
«Мы часто думаем о связывании как об очень простой взаимосвязи — молекула А связывается с молекулой В», — говорит Альберт Кеунг, соавтор исследования, опубликованного в Nature Communications, и доцент кафедры химической и биомолекулярной инженерии в Университете штата Северная Каролина. «Но в биологических системах все далеко не так просто. Молекула А может связываться с десятками других молекул в различной степени.
|
|
|
|
«Уловить эту гиперсложность — серьезная задача, но она имеет решающее значение, если мы хотим лучше понять природные генетические системы», — говорит Кеунг, выдающийся ученый имени Гуднайта в области инноваций в биотехнологии и биомолекулярной инженерии и директор программы биотехнологии в рамках Инициативы интегративных наук Университета штата Северная Каролина. «Уловить эту гиперсложность также крайне важно, если мы хотим разработать инструменты, которые в полной мере используют биомолекулы, такие как диагностические инструменты, чувствительные к генетическим различиям, или системы ДНК-вычислений, которые используют ДНК для хранения и извлечения данных».
|
|
|
|
|
|
|
«Мы знали, что модели глубокого обучения — модели искусственного интеллекта, способные улавливать сложные закономерности, — потенциально могут помочь нам исследовать этот тип гиперсложных систем», — говорит Гунаваран Брихадисваран, соавтор статьи и аспирант Университета штата Северная Каролина. «Однако мы также знали, что нам потребуется надежный набор данных». «Для обучения модели. Качество модели зависит от качества данных, на которых она обучается».
|
|
|
|
Предыдущие попытки разработать инструменты для прогнозирования поведения связывания ДНК-ДНК основывались на относительно небольших наборах данных ДНК-ДНК, а затем использовали инструменты биофизического моделирования для прогнозирования того, какие последовательности ДНК будут связываться с другими последовательностями ДНК. Полученные в результате инструменты прогнозирования с трудом улавливают сложность взаимосвязей связывания.
|
|
|
|
«Мы использовали другой экспериментальный подход, который позволил нам получить значительно больше данных о том, какие последовательности ДНК связываются друг с другом», — говорит Каришма Матанге, соавтор статьи и выпускница аспирантуры Университета штата Северная Каролина. «В общей сложности наша база данных состоит из 144 миллионов пар последовательностей». Этот более обширный набор данных позволил нам использовать модели ИИ, а не экстраполировать данные на основе биофизических или биохимических принципов».
|
|
|
|
В частности, исследователи использовали свой более крупный набор данных для обучения модели глубокого обучения, которая предсказывала, какие последовательности ДНК будут связываться с другими последовательностями ДНК. Они назвали модель BINND: Binding and Interaction Neural Network for DNA (Нейронная сеть связывания и взаимодействия для ДНК).
|
|
|
|
В ходе экспериментального тестирования исследователи обнаружили, что модель BINND предсказывала, какие пары ДНК будут связываться, с точностью 83,5%. А когда она ошибалась, то, как правило, предсказывала, что две последовательности ДНК не будут связываться — хотя на самом деле они связывались.
|
|
|
|
«BINND как минимум на 10% точнее, чем самая современная модель», — говорит Брихадисваран.
|
|
|
|
Чтобы продемонстрировать полезность BINND, исследователи использовали модель для создания базы данных, которая отражает гиперсвязанный характер поведения связывания ДНК-ДНК. База данных представляет собой, по сути, матрицу, показывающую, как 96 20-символьных последовательностей ДНК связываются — или не связываются. BINND связывается с 26 другими 20-символьными последовательностями ДНК.
|
|
|
|
«Эта конкретная демонстрация имеет реальную ценность с точки зрения ДНК-вычислений, поскольку она предоставляет нам ключевую информацию о характеристиках этих последовательностей, что имеет решающее значение для усилий по сбору и извлечению информации с помощью ДНК», — говорит Джеймс Так, соавтор статьи и профессор электротехники и вычислительной техники в Университете штата Северная Каролина. «Мы надеемся, что другие исследователи в научном сообществе будут использовать BINND, поэтому мы делаем его общедоступным на GitHub».
|
|
|
|
«Одной из проблем хранения и обработки данных в ДНК является возможность масштабирования для практического использования», — говорит Кеунг. «Мы оптимистично настроены, что BINND станет ценным инструментом для содействия масштабированию этих технологий, а также для других потенциальных применений».
|
|
|
|
Источник
|