Biológia

DNS-szekvencia GC-aránya: ismeretlen bázisok és a nevező megválasztása

A GC-arányhoz a G és C bázisokat számoljuk, de az N jelek kezelése megváltoztatja a nevezőt. Egy rövid mintán különválasztjuk az ismert rész arányát és a teljes szakasz határait.

Dajka Gábor3 perc olvasás

Egy kizárólag A, C, G és T jelekből álló DNS-szekvencia GC-aránya a G és C bázisok együttes darabszáma osztva a teljes hosszal. Ha ismeretlen pozíciók is vannak a szekvenciában, előbb meg kell határoznod, hogy az ismert részt jellemzed vagy a teljes szakaszról szeretnél becslést adni. A két nevező eltérő kérdésre válaszol.

Egyértelmű szekvencia, egyértelmű arány

Vegyük ezt a saját szemléltető mintát:

ACGCGTACGG

A hossza 10 bázis. Az A kétszer, a T egyszer, a G négyszer, a C háromszor szerepel. Így:

GC% = (G + C) / (A + T + G + C) × 100 = 7 / 10 × 100 = 70%.

A számláló és a nevező is bázisok darabszáma, az arány mértékegység nélküli. A DNS-szekvencia-elemzőbe beírhatod a tízbetűs mintát. Az eszköz A, C, G és T karaktereket fogad el, a kisbetűket nagybetűvé alakítja, a szóközöket és sortöréseket figyelmen kívül hagyja. A GC-számolás különböző megoldásait a Biopython saját dokumentációja is bemutatja.

Mi változik két N hozzáadásával?

A hosszabb szemléltető változat:

ACGCGTACGGNN

Ez 12 pozíció, amelyekből kettő ismeretlen. Az N egy nem meghatározott bázis jelölésére is használatos; az INSDC szekvenciajelölési leírása megkülönbözteti a meghatározott és az N-nel jelölt, meg nem határozott bázisokat. Az N tehát nem egy ötödik, biztosan G-től és C-től különböző bázis.

Az ismert rész GC-aránya továbbra is 70%. Ha a teljes 12 pozícióból csak a biztos G-ket és C-ket számolod a számlálóba, 7 / 12 × 100 ≈ 58,33% adódik. Ez a biztosan GC-ként azonosított pozíciók aránya, és egyben a teljes szakasz GC-arányának alsó határa.

Ha mindkét N valójában G vagy C lenne, a felső határ 9 / 12 × 100 = 75%. A rendelkezésre álló jelölések alapján a teljes szakaszról ennyit állíthatsz:

58,33% ≤ teljes GC-arány ≤ 75%.

Súlyozás: külön feltételezés

Választhatsz olyan becslést, amely minden N-hez fél GC-bázist rendel. A példában a becsült számláló 7 + 2 × 0,5 = 8, ezért az eredmény 8 / 12 × 100 ≈ 66,67%.

A Biopython súlyozott módja is használ ilyen értéket N esetén. Ettől azonban még nem tudtuk meg a két tényleges bázist. A 0,5 súly egy választott kezelési szabály; a saját adataid keletkezése vagy összetétele más feltételezést indokolhat.

Számítás tárgyaNevezőEredmény
Ismert A/C/G/T rész1070%
Biztos GC a teljes hosszon1258,33%
Teljes lehetséges maximum1275%
N-enként fél GC becslés1266,67%

Mit írj a kalkulátorba?

A DG elemző az N-t tartalmazó bemenetet jelzi, nem dönt helyetted annak értelmezéséről. Ha az ismert rész arányát akarod ellenőrizni, külön másolatban megtarthatod a tíz ismert bázist, de az eredmény mellé írd oda, hogy az eredeti 12 pozícióból kettőt kihagytál. A teljes hosszal számított határokat a fenti módon számold ki.

A formátum leíró fejléceit se add meg bázissorozatként. Az üres vagy kizárólag ismeretlen bázisokból álló szakasznál az ismert rész nevezője nulla: ebből nem következik 0% GC. Ilyenkor az ismert rész aránya nem meghatározható.

Két szekvencia összehasonlításakor a hosszt, az ismeretlen pozíciók számát és a nevező szabályát együtt közöld. A példában a 70% és az 58,33% ugyanazokból a biztos bázisokból származik; a különbséget teljes egészében a nevező választása okozza.

További cikkek
Gyorskereső

Kalkulátorok és útmutatók keresése

↑↓ választásEnter megnyitásEsc bezárás