科学者はどのようにあなたのゲノムを解読するのか?シーケンシングリードから信頼できる変異同定まで、その過程で一体何が起きているのか
シーケンシング(Sequencing):生体分子をデジタルリードに変換する ゲノムシーケンシングの最初のステップは、物理サンプル(血液や唾液中のDNAなど)を断片化し、シーケンサーで読み取ることで、数億個に及ぶ短いDNA配列、すなわち「シーケンシングリード(reads)」を生成することです。現在、主に2つのシーケンシング技術が存在します: ショートリードシーケンシング(Illuminaなど): 比較的短い(75〜250塩基)ものの、極めて精度の高いリードを生成します。ハイスループットかつコスト効率に優れるため、現在最も幅広く使われている基盤技術です。ロングリードシーケンシング(PacBioやOxford Nanoporeなど): 一度に数千から数百万塩基に及ぶ超長鎖DNA断片を読み取ることができます。
「パンゲノム」とは何か、なぜ従来の単一参照ゲノムでは不十分なのか
パンゲノム(Pangenome)は、多様性をより的確に反映したまったく新しいゲノムマップであり、世界中の多様な集団から得られた複数個人のゲノム参照配列(例えば、Human Pangenome Reference Consortiumが統合した、遺伝的に多様な47個体の二倍体アセンブリ)を1つの統一された参照構造に集約したものです。従来の線状(リニア)配列とは異なり、パンゲノムは一般にグラフデータ構造(Graph data structures)を用いて表現されます。グラフ内のノードは集団内で知られている配列の集合を表し、それらのノードを通過するパス(経路)が、個人の固有なDNA配列をコンパクトに記述します。この手法により、パンゲノムは集団全体の遺伝的変異を参照モデルへ直接組み込むことを可能にしています。
従来の単一参照ゲノム(GRCh38など)ではもはや不十分とされる主な理由は、以下の主要な限界にあります:
DeepVariantがDNAデータを画像に変換した後、精度は一体どれほど向上したのか
DeepVariantが変異検出を画像分類問題に変換したことで、精度は飛躍的な向上を遂げました。畳み込みニューラルネットワーク(CNN)は、関連するすべてのシーケンスリードを1枚のマルチチャネル画像として同時に処理できるため、従来の統計アルゴリズム(リードのエラーが独立していると誤って仮定していた)では処理できなかった複雑な依存関係を捕らえることに成功しました。
元データによると、精度の向上は具体的に以下の点に表れています:
全体のエラー率が50%以上低下 FDAが主催した精密医療変異検出チャレンジ(Truth Challenge)において、フィルタリング閾値などのパラメータを調整することなく、DeepVariantは2位の従来のアルゴリズムと比較して、ゲノムあたりの総エラー数を50%以上削減しました(DeepVariantのエラー数はわずか4,652件であったのに対し、2位のアルゴリズムは9,531件でした)。
DeepVariantのような深層学習ツールは、なぜ従来のアルゴリズム以上にゲノムを巧みに「解読」できるのか
DeepVariantをはじめとする深層学習ツールが、GATKなどの従来アルゴリズム以上にゲノムを「解読」できる根本的な理由は、ゲノム変異検出を「専門家の経験に基づく統計モデリング」から「データ駆動型の画像分類問題」へと転換させた点にあります。このパラダイムシフトにより、従来のアルゴリズムを凌駕するいくつかの核心的な強みがもたらされました。
「シーケンシングエラーは相互に独立している」という従来の仮説を打破 従来のアルゴリズム(ロジスティック回帰や隠れマルコフモデルを使用するGATKなど)は、統計モデルを構築する際、数学的に解くことを可能にするため、通常、シーケンシングリード(reads)のエラーが相互に独立していると仮定していました。しかし実際には、シーケンサーの系統的誤差やゲノム自体の複雑な構造によって、複雑な相関エラーが生じます。
21xのシーケンス深度で従来の30xと同等の精度を達成できるとすれば、大規模ゲノムシーケンスにおいてどれほどのコスト削減が可能になるでしょうか
資料によると、標準的な30x全ゲノムシーケンスのコストを1,000ドルと仮定し、コストがシーケンス深度と線形(比例)関係にあるとすると、DeepVariantを使用することでゲノム1件あたり約250ドルを削減できます。
これは、DeepVariantが22x〜23xのシーケンス深度において、従来のツール(GATK4-HCなど)が30x深度で出す総エラー数と同等の精度を達成できるためです。
さらに、資料ではより高い深度におけるコスト削減についても触れられています。DeepVariantの27x深度におけるエラー数は、GATK4-HCの50x深度におけるエラー数とほぼ同等です。同様の線形コストで計算すると、50xのシーケンス基準と比較して、ゲノム1件あたり約766ドルの削減に相当します。
DNAを画像化するDeepVariantのような技術は、がんなどの複雑な体細胞変異の検出にも利用できるのでしょうか?
実際、科学者たちはDeepVariantの核心技術をベースに、がんの体細胞変異検出に特化した新しいディープラーニングツール「DeepSomatic」を開発しました。
体細胞変異(がんなどで生じる変異)の検出は、生殖細胞変異の検出よりも複雑です。なぜなら、がんサンプルは通常、異なるクローン細胞群から構成される「モザイク構造」であり、多様で複雑な変異過程やシグネチャー(変異の痕跡)を伴うためです。DeepSomaticは、この極めて困難な領域に画像化技術を応用することに成功しました。その主な特徴は以下の通りです:
画像構築における巧みな改変: DeepSomaticはDeepVariantを大幅に最適化しており、最も重要な変更点は、パイルアップ画像(pileup images)を改変し、1枚の画像内に「腫瘍サンプル」と「正常対照サンプル」の双方に由来するアライメント済みリードを同時に含めるようにした点です。
超高速全ゲノムシーケンスはどのようにして数時間で重篤な希少疾患の診断を可能にするのか?残された課題とは
超高速全ゲノムシーケンス(WGS)は、いかにして数時間以内での診断を実現するのか?
新生児集中治療室(NICU)などの重症ケア環境において、希少遺伝性疾患をタイムリーに診断することは救命につながる。ナノポア(Nanopore)ロングリードシーケンス技術とディープラーニングを組み合わせることで、研究者らは全ゲノムシーケンスから診断に至るまでの時間を8時間未満に短縮することに成功した(例えば、57歳の両肺移植候補患者と14ヶ月の乳児の症例では、それぞれわずか7時間18分と7時間48分しか要しなかった)。
本コンテンツは研究レポートの閲覧と理解のためのものであり、投資助言や取引シグナルを構成するものではありません。
アプリで詳しく読む
世界の主要機関レポートを構造化。スマホでいつでも快適に閲覧。
本コンテンツはレポート理解のためのものであり、投資助言を構成しません。