Sequenza proteica

La lunghezza del ramo è il numero atteso di sostituzioni per sito per punto temporale. Ogni lignaggio evolve in modo indipendente dall'antenato.

Risultati

Simulatore di mutazioni per sequenze proteiche

Incolla una sequenza proteica, imposta una lunghezza del ramo e un numero di punti temporali, e questo simulatore di mutazioni fa evolvere diversi lignaggi indipendenti da quell’antenato secondo un vero modello di sostituzione. Ogni nuova sostituzione è segnata in rosso sulla cronologia, il blocco dei risultati le riassume e il link che condividi riproduce esattamente l’esecuzione.

Come funziona la simulazione

Il simulatore usa il modello di Markov a tempo continuo alla base della filogenetica moderna. Dai tassi di scambiabilità e dalle frequenze di equilibrio degli amminoacidi del modello scelto costruisce la matrice dei tassi Q, la scala in modo che un’unità di lunghezza del ramo equivalga a una sostituzione attesa per sito e calcola la matrice di transizione P = exp(Qt) per la lunghezza del ramo t che imposti. A ogni punto temporale ogni sito di ogni lignaggio estrae il suo residuo successivo dalla riga di P corrispondente al residuo attuale. Il tempo si accumula di una lunghezza di ramo per punto, quindi cinque punti a 0,1 coprono una distanza totale di 0,5 sostituzioni per sito dall’antenato.

Scegliere un modello

Leggere la cronologia e i risultati

L’antenato sta in cima. Sotto, ogni punto temporale elenca una riga per lignaggio con le sostituzioni avvenute in quel passo in rosso grassetto, le differenze precedenti dall’antenato in rosso sbiadito e le etichette delle mutazioni dopo la riga, quindi I3V significa che l’isoleucina in posizione 3 è diventata valina. Il blocco dei risultati conta le sostituzioni in totale e per lignaggio, stampa il numero atteso per sequenza, che è la lunghezza totale del ramo moltiplicata per la lunghezza della sequenza, il numero di sequenze finali uniche, la distanza media a coppie tra i lignaggi in differenze per sito e l’identità delle sequenze finali con l’antenato. Copia il report mette i numeri e le sequenze finali negli appunti.

Un esempio svolto

La sequenza di esempio è la catena A dell’insulina, di 21 residui. Con le impostazioni predefinite, lunghezza del ramo 0,1, cinque punti temporali e cinque lignaggi, la distanza totale è 0,5 per sito, quindi il conteggio atteso è di 10,5 sostituzioni per lignaggio. Le esecuzioni si collocano intorno a quel valore, e l’identità con l’antenato finisce vicino al 60-70 percento anziché al 50, perché un sito che cambia due volte conta comunque come una sola differenza e alcuni siti tornano indietro. A lunghezza del ramo 1 i lignaggi divergono così tanto che quasi ogni posizione differisce dall’antenato, il regime in cui il segnale filogenetico si satura.

Limiti

Le sequenze vengono tagliate a 2.000 residui, le righe di intestazione FASTA vengono rimosse e solo i venti amminoacidi standard vengono fatti evolvere. Non ci sono inserzioni, delezioni, variazione del tasso tra i siti né selezione oltre all’opzione dei siti conservati: l’output illustra la sostituzione neutrale, non prevede come evolve una particolare proteina.

Domande frequenti

Quali modelli di sostituzione usa il simulatore?

JTT (Jones, Taylor e Thornton, 1992) e WAG (Whelan e Goldman, 2001), due modelli empirici per gli amminoacidi stimati da grandi insiemi di allineamenti proteici reali, più un modello uniforme in cui ogni amminoacido ha la stessa probabilità di trasformarsi in qualsiasi altro. I modelli empirici rendono i cambiamenti conservativi, come isoleucina in valina, molto più probabili di, per esempio, triptofano in glicina.

Che cosa significa qui la lunghezza del ramo?

La lunghezza del ramo è la distanza evolutiva misurata in sostituzioni attese per sito, l'unità usata sugli alberi filogenetici. A 0,1 ci si aspetta che ogni sito cambi circa una volta su dieci per punto temporale, quindi una proteina di 100 residui accumula circa 10 sostituzioni per punto, meno dove un sito cambia e poi torna indietro.

Perché il risultato è diverso ogni volta che lo eseguo?

Ogni sito estrae il suo nuovo residuo a caso dalle probabilità del modello, quindi due esecuzioni non coincidono mai. Esegui di nuovo estrae una simulazione fresca; il link di condivisione contiene il seme, e aprendolo si riproduce esattamente la stessa cronologia.

Che cosa misura l'identità con l'antenato?

La quota di posizioni, mediata su tutti i lignaggi, in cui la sequenza finale ha ancora il residuo ancestrale. Colpi multipli sullo stesso sito contano come una sola differenza, ed è per questo che l'identità scende più lentamente di quanto salga il conteggio delle sostituzioni.

Il simulatore modella la selezione?

Solo in un modo semplice: l'opzione Fissa C, H, D, E blocca cisteina, istidina, aspartato e glutammato, i residui che si trovano più spesso nei siti attivi e nei ponti disolfuro. Tutto il resto evolve in modo neutrale; non ci sono inserzioni né delezioni, e i siti evolvono indipendentemente l'uno dall'altro.