A
AB1 Genotype Viewerv0.6.0
使い方・解説
← ツールに戻る

AB1 Genotype Viewer 使い方・解説

サンガーシーケンスの .ab1 ファイルから、狙った位置の遺伝型(ホモ/ヘテロ)を判定して Excel にまとめるツールです。ブラウザだけで動き、データはどこにも送信されません。

1. このツールは何をするか

サンガーシーケンス(キャピラリーシーケンス)で得られる .ab1 ファイルには、A/T/G/C 4色の蛍光波形(クロマトグラム)が入っています。SNPタイピングでは、この波形のある1か所を見て、

を読み取ります。従来これは、1ファイルずつビューアで開き、目で波形を追い、目的の位置を探して、判定を手でExcelに転記する作業でした。サンプルが数十件あると時間がかかり、しかも

という間違いやすい要素が揃っています。このツールは、複数のAB1をまとめて読み込み、向きを自動で揃え、目的の位置を数値(蛍光強度の比率)で判定して、一覧とExcelにするところまでを自動化します。

やっていることを一言でいうと 「波形の目視判定」を「ピーク高さの比率による数値判定」に置き換え、全サンプルを同じ基準・同じ座標軸で並べて見られるようにするツールです。

2. こんなときに使う

ケース1 ── SNPジェノタイピングの結果判定

多型のある1か所について、被験者・検体ごとの遺伝型を決めたい。プライマーで増幅してシーケンスに出し、返ってきた .ab1 を全部ドロップして、目的位置の遺伝型(A/A・A/G・G/G)を一覧で得る、という使い方です。もっとも想定している使い方です。

ケース2 ── 変異導入・クローニングの確認

変異を入れたプラスミドやゲノム編集クローンで、狙った塩基が入っているか、ホモかヘテロか(片アレルだけ変異したのか)を確認する。角括弧に「野生型/変異型」を書いておけば、両方入っているクローンがヘテロとして出ます。

ケース3 ── シーケンス全体に二重ピークがないかの確認

ターゲット配列を空欄のまま解析すると、各ファイルの全塩基について二重ピークの有無を調べます。「このクローンは単一か、それとも複数の配列が混ざっているか」「どこかに予期しないヘテロ位置がないか」を見るときに使います。

ケース4 ── 大量サンプルの一次スクリーニング

何十検体もあるとき、まず全部通して、判定が付いたものと「要確認」になったものに仕分けし、要確認のものだけ波形を目で見る、という流れに使えます。シーケンス自体が失敗しているファイル(ベースコールが NNNN… のもの)も自動で分離されます。

3. クイックスタート

index.html をダブルクリックしてブラウザで開くだけです。インストールもサーバーも不要です(Safari/Chrome で動作確認済み)。

  1. AB1ファイルをドロップ
    画面上部の点線枠に .ab1 / .abi をまとめてドラッグ&ドロップします(枠をクリックしてファイル選択でも可)。
  2. ターゲット配列を入れる(任意)
    判定したい位置を角括弧で囲んだ配列を貼り付けます。空欄のままでも構いません。その場合は全塩基のホモ/ヘテロ判定モードになります。
  3. 「ターゲットを解析」を押す
    各サンプルの向き判定・位置合わせ・遺伝型判定がまとめて走ります。
  4. 結果を確認する
    左に判定、右に波形が並びます。塩基にポイントすると比率や蛍光強度が出ます。クリックすると下の詳細欄に反映されます。
  5. 「Excelで一括出力」
    全サンプルの判定を .xlsx にまとめてダウンロードします。

4. 入力

4.1 AB1 / ABI ファイル

Applied Biosystems のシーケンサが出力する ABIF 形式のファイルです。受託シーケンス(Eurofins、ファスマック、マクロジェン等)から返ってくる .ab1 がそのまま使えます。ファイル内の以下のデータを読んでいます。

タグ内容
PBAS1/2ベースコール結果(塩基配列)
PLOC1/2各塩基に対応する波形上のピーク位置
PCON1/2各塩基の Quality score(表示のみに使用)
DATA9-12解析済みの4色蛍光波形
FWO_波形のチャンネルと塩基の対応順(ファイルごとに読む)
SMPL / MCHN / S/N%サンプル名・装置名・S/N比

4.2 ターゲット配列(角括弧記法)

判定したい1か所を [A/G] のように角括弧で囲み、その前後の配列と一緒に貼り付けます。前後の配列は、どのサンプルがどこを読んでいるかを突き合わせるための目印として使います。

ATCGCCATG[A/G]ATTCCTGAC…
空欄にした場合 照合も向き判定も行わず、各ファイルを読まれたままの向きで表示して、全塩基位置についてホモ/ヘテロを判定します(ケース3)。

5. 設定項目

項目既定値意味・調整のしかた
ターゲット名Target-1 Excelの「ターゲット名」列に出る見出しです。判定には影響しません。遺伝子名や座位名を入れておくと、複数回の出力をまとめるときに区別できます。
最小蛍光強度500 その位置の4チャンネル合計の蛍光強度がこの値未満なら、信号が弱すぎるとみなして N(判定不能)にします。
上げると判定が厳しくなり、読み終わり付近の弱いシグナルを切り捨てます。下げると弱いリードでも判定を出しますが、ノイズを拾いやすくなります。
最小コール比率0.20 ホモとヘテロを分ける閾値です。4チャンネルを合計1.0に正規化し、この比率以上の塩基を「存在する」とみなします。該当が1つならホモ、2つならヘテロ、3つ以上なら要確認。
上げる(0.25〜0.30)とヘテロ判定が厳しくなり、色のにじみによる偽ヘテロが減りますが、第2ピークの低い本物のヘテロを取りこぼします。下げると逆になります。
アライメント一致率下限0.80 サンプルとターゲット配列を照合したときの一致率がこの値未満なら「アライメント不可」とし、判定を出しません。別座位のサンプルが混ざっていた場合に、ここで弾かれます。
プライマーの読み始めが汚いなど一致率が伸びないときは 0.70 程度まで下げます。

設定を変えると自動で再解析されます。ファイルを読み込み直す必要はありません。

6. 画面の見方

左の3列(サンプル名・判定・読取方向)は固定で、右の配列部分だけが横スクロールします。

7. 判定のしくみ

7.1 向きの判定とアライメント

各サンプルの配列を、ターゲット配列に対してそのままと逆相補の両方で1塩基ずつずらしながら照合し、もっともよく一致した位置と向きを採用します。一致(+1)/不一致(−1)/N(±0)で採点するため、ベースコールが N の位置はスコアに影響しません。挿入・欠失は考慮しないギャップなし照合です。

7.2 対象位置の測定

角括弧の位置に対応するサンプル上の塩基を特定し、その塩基のピーク位置における4チャンネルの蛍光強度を読みます。負の値は0に丸めます。

対象位置の蛍光強度   A: 19   T: 58   G: 776   C: 0
合計                 853
比率                 A:0.022  T:0.068  G:0.910  C:0.000

7.3 遺伝型の決定

  1. 合計強度が最小蛍光強度未満 → N(判定不能)
  2. 4つの比率のうち、最小コール比率以上のものを候補とする(0.20ちょうどは候補に含める)
  3. 候補が1つ → ホモ(例 G/G)
  4. 候補が2つ → ヘテロ(例 A/G、表記順は A→T→G→C に固定)
  5. 候補が3つ以上 → 要確認(混合ピーク・コンタミの可能性)
  6. 候補が0 → 要確認(信号はあるが、どれも閾値に届かない)

角括弧に書いていない塩基が検出された場合も、判定は出したうえで「要確認」フラグを付けます。

ベースコーラーより細かく拾えることがあります シーケンサのベースコール結果が N になっている位置でも、波形の比率を直接見るため、ピークがはっきりしていれば遺伝型を出せます。

7.4 ターゲット未指定モードの判定

照合も向き判定も行いません。読めている全塩基位置に 7.3 と同じ基準を当て、候補が2つになった位置(=ヘテロ)を拾い出して、配列上で強調表示・一覧表示します。最小蛍光強度を満たさない位置は判定対象から外します。

8. Quality score を使わない理由

AB1ファイルには、ベースコーラーが算出した塩基ごとの Phred quality score(Q = -10 log₁₀(誤りの確率))が入っています。このツールは、Quality score を判定の足切りには使いません。値はツールチップ・詳細欄・Excelに表示するだけです。

理由は、Quality score の計算に使われる指標のひとつが「コールされなかった塩基の最大ピーク高 ÷ コールされた塩基のピーク高」だからです。これは、このツールがヘテロ判定に使っている第2ピークの比率とほぼ同じものです。つまり、

ヘテロ位置では Quality score が必ず下がる ベースコーラーは「2つのピークが立っていて、どちらか決められない」位置に低いQを付けます。したがって Quality で足切りすると、探している対象そのものを先に捨ててしまいます。

実データ(ACE1 コントロール、533塩基)で Q と第2ピーク比率の関係を集計すると、はっきり逆相関します。

Q 40以上   n= 35   第2ピーク比率 中央値 0.025
Q 30-39   n=131   中央値 0.146
Q 20-29   n=209   中央値 0.202
Q 15-19   n= 72   中央値 0.258
Q 10-14   n= 57   中央値 0.333

実際、Q下限20で運用していたとき、ある検体の真のヘテロ位置(A 55.9% / G 39.9%)は Q=12 だったために判定から除外されていました。この経緯から、Quality による足切りは廃止しています。シグナルの弱い位置を外す役割は最小蛍光強度が担います。

9. Excel出力

「Excelで一括出力」で、読み込んだ全サンプルの判定を1つの .xlsx にまとめます。外部ライブラリを使わずファイルを生成しているため、オフラインでも動きます。

列内容
サンプル名 / 元ファイル名AB1内のサンプル名と、読み込んだファイル名
ターゲット名設定した名前。未指定モードでは「(ターゲット未指定)」
判定 / 遺伝型ホモ・ヘテロ・要確認などと、G/G のような遺伝型
実測対象塩基その位置のベースコール結果(N のこともある)
位置対象位置。未指定モードではヘテロ位置のサンプル内塩基番号
A/T/G/C比率4チャンネルの比率(0〜1の小数、小数第4位)
A/T/G/C蛍光強度各チャンネルの生の蛍光強度
Quality scoreその位置のPhred quality(判定には使っていない参考値)
元の読取方向Forward / Reverse
アライメント可否可/不可(理由付き)
コメント判定の根拠、要確認の理由、エラー内容

ターゲット指定モードでは1サンプル1行、未指定モードではヘテロ位置1つにつき1行(0箇所のサンプルは要約1行)で出力します。

10. 判定できないときの表示

判定が出せない場合も、理由を区別して表示・出力します。黙って空欄にはしません。

状態意味・対処
読込失敗ABIF形式として読めないファイル。拡張子だけ .ab1 の別物でないか確認してください。
ベースコールされた塩基がありません配列が NNNN… のみ。シーケンス自体の失敗です(テンプレート不足、プライマー不良など)。再シーケンスが必要です。
ターゲットシーケンスとアライメントできませんでした一致率が下限未満。別座位のサンプル、ターゲット配列の打ち間違い、または読めている領域が目的位置に届いていない場合に出ます。
対象位置を判読できません照合はできたが、目的の位置がリードの範囲外。読み始め/読み終わりが足りていません。
N/判定不能蛍光強度が最小蛍光強度未満。
要確認(3塩基以上)閾値以上の塩基が3種類以上。コンタミ、複数テンプレートの混在、ノイズを疑います。
重複読込同じファイル名を再度ドロップした場合は追加せず警告します。AB1内のサンプル名が重複している場合は、別ファイルとして読み込んだうえで警告します。

11. 制限事項

12. データの扱い

AB1データは外部に送信されません ファイルの読み込み、波形の解析、判定、Excelの生成まで、すべてブラウザの中(JavaScript)で完結します。サーバーへのアップロードは一切行いません。外部ライブラリ・CDNも使用していないため、ネットワークを切断した状態でも動作します。

配布物は index.html と js/ だけです。社内ネットワークやオフライン環境のPCにフォルダごと置いて使えます。

この公開サイトでの利用統計

公開サイト(ab1-snp.app.saltybullet.com)では、どの機能がどれだけ使われているかを把握するために、次の情報だけを当サイト自身のサーバーに記録しています。Googleアナリティクスなどの外部サービスは使っていません。

記録するもの内容
ページの閲覧閲覧したページ、参照元(どのサイト・検索から来たか)、ブラウザの種類、日時、IPアドレス(Webサーバーの標準的なアクセスログ)
操作の回数読み込んだファイル数、解析の実行回数、ターゲット指定かスキャンかの別、設定したしきい値、Excel出力の回数
記録しないもの AB1ファイルそのもの、塩基配列、ターゲット配列、ファイル名、サンプル名、遺伝型の判定結果、波形。これらがサーバーへ送られることはありません。Cookieも使っていません。

ブラウザの「追跡拒否(Do Not Track)」または Global Privacy Control が有効な場合、操作回数の記録は自動的に行いません。手動で止めるには、次のスイッチをオフ側(チェック)にしてください(このブラウザにのみ適用されます)。

ダウンロードして file:// やローカルサーバーで使う場合は、この記録は一切行われません。

13. よくある質問

AB1ファイルはアップロードされますか?

いいえ。ファイルの読み込み、波形の解析、遺伝型の判定、Excelの生成まですべてブラウザの中(JavaScript)で実行されます。AB1ファイルや塩基配列がサーバーへ送られることは一切ありません。外部ライブラリ・CDNも使っていないため、ネットワークを切断した状態でも動作します。なお公開サイトでは、どの機能が何回使われたかという利用統計のみを当サイト自身が記録しています(データの扱い)。

ホモとヘテロはどう判定していますか?

対象位置のピーク位置における A/T/G/C 4チャンネルの蛍光強度を合計1.0に正規化し、最小コール比率(既定0.20)以上の塩基を候補とします。候補が1つならホモ、2つならヘテロ、3つ以上なら要確認です。合計強度が最小蛍光強度(既定500)未満のときは N(判定不能)とします。

Reverseプライマーで読んだサンプルも使えますか?

使えます。ターゲット配列に対してそのままと逆相補の両方で照合し、よく一致したほうを採用します。Reverseの場合は配列・ピーク位置・4色チャンネルすべてを逆相補変換して、ターゲットと同じ向きに揃えて表示します。元の読取方向は Forward/Reverse として記録・出力されます。

ターゲット配列を入れずに解析するとどうなりますか?

照合も向き判定も行わず、各ファイルを読まれたままの向きで表示して、全塩基位置についてホモ/ヘテロを判定します。クローンに二重ピークが混ざっていないかを確認したいときに使います。

Quality score が低い位置は除外されないのですか?

除外しません。Phred quality score の算出指標のひとつが「コールされなかった塩基の最大ピーク高 ÷ コールされた塩基のピーク高」で、ヘテロ判定に使う第2ピークの比率とほぼ同じものです。ヘテロ位置では原理的に Quality が下がるため、Quality で足切りすると探している対象そのものを捨てることになります。値は表示のみに使います。

ベースコールの文字と判定結果が食い違うことがあるのはなぜですか?

配列欄に表示している文字は、AB1ファイルに記録されたベースコール結果(PBAS)をそのまま出しているためです。遺伝型の判定は、それとは別にピーク高さの比率から行っています。二重ピークの位置ではベースコーラーが低いほうの塩基を選ぶことがあり、その場合に食い違いが生じます。

挿入・欠失(indel)を含むサンプルは判定できますか?

できません。ターゲット配列との照合はギャップを許さないスライド照合のため、indelを含むリードは一致率が下がり、アライメント不可になることがあります。

対応しているファイル形式は何ですか?

Applied Biosystems のシーケンサが出力する ABIF 形式(.ab1 / .abi)です。受託シーケンスから返ってくるファイルをそのまま読み込めます。