Proteinsequenz

Die Astlänge ist die erwartete Zahl der Substitutionen pro Position und Zeitpunkt. Jede Linie entwickelt sich unabhängig vom Vorfahren.

Ergebnisse

Mutationssimulator für Proteinsequenzen

Füge eine Proteinsequenz ein, lege eine Astlänge und eine Zahl von Zeitpunkten fest, und dieser Mutationssimulator lässt mehrere unabhängige Linien aus diesem Vorfahren unter einem echten Substitutionsmodell entstehen. Jede neue Substitution ist im Verlauf rot markiert, der Ergebnisblock zählt sie zusammen, und der Link, den du teilst, reproduziert den Lauf exakt.

Wie die Simulation funktioniert

Der Simulator verwendet das zeitkontinuierliche Markov-Modell, das hinter der modernen Phylogenetik steht. Aus den Austauschraten und den Gleichgewichtsfrequenzen der Aminosäuren des gewählten Modells baut er die Ratenmatrix Q, skaliert sie so, dass eine Einheit Astlänge einer erwarteten Substitution pro Position entspricht, und berechnet die Übergangsmatrix P = exp(Qt) für die von dir gesetzte Astlänge t. An jedem Zeitpunkt zieht jede Position jeder Linie ihren nächsten Rest aus der Zeile von P, die zu ihrem aktuellen Rest gehört. Die Zeit summiert sich um eine Astlänge pro Zeitpunkt, fünf Zeitpunkte bei 0,1 umfassen also eine Gesamtdistanz von 0,5 Substitutionen pro Position vom Vorfahren.

Ein Modell wählen

Verlauf und Ergebnisse lesen

Der Vorfahr steht oben. Darunter listet jeder Zeitpunkt eine Zeile pro Linie, mit den Substitutionen dieses Schritts in fettem Rot, früheren Unterschieden zum Vorfahren in blassem Rot und den Mutationsbezeichnungen hinter der Zeile, I3V bedeutet also, dass Isoleucin an Position 3 zu Valin wurde. Der Ergebnisblock zählt die Substitutionen insgesamt und pro Linie, gibt die erwartete Zahl pro Sequenz an, das ist die Gesamt-Astlänge multipliziert mit der Sequenzlänge, die Zahl eindeutiger Endsequenzen, die mittlere paarweise Distanz zwischen den Linien als Unterschiede pro Position und die Identität der Endsequenzen zum Vorfahren. „Bericht kopieren“ legt die Zahlen und die Endsequenzen in die Zwischenablage.

Ein durchgerechnetes Beispiel

Die Beispielsequenz ist die A-Kette des Insulins mit 21 Resten. Mit den Standardwerten, Astlänge 0,1, fünf Zeitpunkte und fünf Linien, beträgt die Gesamtdistanz 0,5 pro Position, die erwartete Zahl liegt also bei 10,5 Substitutionen pro Linie. Läufe landen um diesen Wert, und die Identität zum Vorfahren endet eher bei 60 bis 70 Prozent als bei 50, weil eine Position, die sich zweimal ändert, trotzdem als ein Unterschied zählt und manche Positionen zurückmutieren. Bei Astlänge 1 entfernen sich die Linien so weit, dass fast jede Position vom Vorfahren abweicht, der Bereich, in dem das phylogenetische Signal in Sättigung geht.

Grenzen

Sequenzen werden bei 2.000 Resten abgeschnitten, FASTA-Kopfzeilen entfernt, und nur die zwanzig Standard-Aminosäuren entwickeln sich. Es gibt keine Insertionen, Deletionen, Ratenvariation zwischen Positionen oder Selektion über die Option für konservierte Positionen hinaus: Die Ausgabe veranschaulicht neutrale Substitution, sie sagt nicht voraus, wie sich ein bestimmtes Protein entwickelt.

Häufige Fragen

Welche Substitutionsmodelle verwendet der Simulator?

JTT (Jones, Taylor und Thornton, 1992) und WAG (Whelan und Goldman, 2001), zwei empirische Aminosäuremodelle, die aus großen Sammlungen echter Protein-Alignments geschätzt wurden, sowie ein gleichverteiltes Modell, in dem jede Aminosäure mit gleicher Wahrscheinlichkeit in jede andere übergeht. Die empirischen Modelle machen konservative Änderungen wie Isoleucin zu Valin weit wahrscheinlicher als etwa Tryptophan zu Glycin.

Was bedeutet Astlänge hier?

Die Astlänge ist die evolutionäre Distanz, gemessen in erwarteten Substitutionen pro Position, die Einheit auf phylogenetischen Bäumen. Bei 0,1 ändert sich jede Position pro Zeitpunkt erwartungsgemäß etwa einmal in zehn, ein Protein mit 100 Resten sammelt also grob 10 Substitutionen pro Zeitpunkt an, weniger, wo eine Position sich ändert und wieder zurückändert.

Warum ist das Ergebnis bei jedem Lauf anders?

Jede Position zieht ihren neuen Rest zufällig aus den Wahrscheinlichkeiten des Modells, zwei Läufe stimmen also nie überein. „Erneut ausführen“ zieht eine frische Simulation; der Teilen-Link enthält den Startwert, und wer ihn öffnet, reproduziert genau denselben Verlauf.

Was misst die Identität zum Vorfahren?

Den Anteil der Positionen, gemittelt über alle Linien, an denen die Endsequenz noch den Rest des Vorfahren trägt. Mehrfache Treffer an einer Position zählen als ein Unterschied, weshalb die Identität langsamer sinkt, als die Substitutionszahl steigt.

Modelliert der Simulator Selektion?

Nur auf eine einfache Weise: Die Option „C, H, D, E behalten“ friert Cystein, Histidin, Aspartat und Glutamat ein, die Reste, die am häufigsten in aktiven Zentren und Disulfidbrücken vorkommen. Alles andere entwickelt sich neutral; es gibt keine Insertionen oder Deletionen, und die Positionen entwickeln sich unabhängig voneinander.