Topic : « OMG! Je suis a 15% malgache đŸ˜± »

Avatar de laplantevertent laplantevertent
Prenez cette séquence
CGAAAATG

imaginez que vous la coupez en des morceaux de trois aléatoires
Ce qui vous donne des :

GCA
AAA
ATG

mais aussi CAA , AAT AAA (bis) ATG

Tous ces petits morceaux sont ce qui sort de votre séquenceur et que vous allez lire . Comment la reconstituez-vous.

Soit vous avez de la chance et quelqu'un l'a déjà fait pour vous et vous avez un génome de séquence . Il vous suffit "juste" de coller les morceaux au génome de référence un peu comme si vous faisiez ctr -f sur un texte.

Soit vous en avez et /ou vous ne voulez pas utiliser le génome déjà présent .

La vous devez faire un assemblage "de novo" en gros fait du puzzle vous remarquez que vous avez GCA CAA et AAA , donc un chemin probable GCA
CAA
AAA
Dans les faits, faites ça sur des extrémités de segments de 100 pb avec certaines précautions supplémentaires, mais c'est l'idée.

Donc déjà vous voyez que tous les "génome" sont en réalité des propositions théoriques ou l'on doit assumer la probabilité de certains chemins.

Mais du coup qu'est ce qui nous assure qu'il n'y a qu'un seul AAA ?

Reprenez depuis le début.
Vous avez toute une soupe de petits fragments de votre gĂ©nome , pleins de GCA , pleins d’AAA, etc. Mais leurs quantitĂ©s respectives ne sont pas nĂ©cessairement un bon indicateur de leur abondance dans le gĂ©nome.

Reprenez la mĂ©thode du Puzle avec un gĂ©nome comme si CGAAAAAAATG. Ou mĂȘme CGAAAAAAAAAAAAAAAAAAAAAAAAAAAAATG si vous appliquez l’hypothĂšse de parcimonie vous en pouvez ĂȘtre sur que de AAA et AAA(bis) .

Mais la un jeune BoucledeBarnard naĂŻf va dĂ©barquer pour me dire que l’hypothĂšse de parcimonie est par dĂ©faut la plus raisonnable , sauf que ... non pas en gĂ©nĂ©tique.

Il existe plein de classe de mutations qui consistent en des multiplication de certaines parts du génome. Les éléments transposables notamment .

Et leur impact sur votre biologie sont négligeable , tous comme sur les algorithmes de classification.

Par ce que ça CGAAAATG et ça CGAAAATA c'est peut ĂȘtre relativement proche , mais ça CGAAAATG et ça CGAAAAAAAAAAAAAAAAAAAAAAATA beaucoup moins.

Sachant que vous pouvez trÚs bien en acquérir au cours de l'évolution que les perdre.

C'est d'ailleurs pour ça qu'il faut distinguer la distance génétique des modifications de la distance d'édition (ex une plante domestique qui a dupliqué tout un chromosome par rapport a la sauvage )

Du coup pour pallier a ça les chercheurs séquencent réguliÚrement les génomes avec de nouvelles technologies qui permettent des cadres de lectures plus longs afin d'enfermer ses séquences répétées dans un fragment , quitte à combiner plus cadres de lectures pour pallier au manque de précision des plus grandes.

Rien que ca devrait calmer les envolés lyriques de Sekiin sur la pyhlogénie humaine


Mais passon au pire du pire , les boites comme my dna etc.

Quand elles vous vendent de retracer votre origine contre votre fichage dans des bases de donnĂ©es qui vont se faire hacker dans cinq ans est les 15 pygmĂ©es chopĂ©s dans le premier village chargĂ© de dire a l'algo Ă  quel point vous ĂȘtes Ă©loignĂ©s d'eux sont au point ? Est-ce qu'ils ont bien Ă©tĂ© sĂ©quencĂ©s avec les derniĂšres technologies ?

Est-ce que vous savez au moins sur quel échantillonnage de la population humaine ils se basent ?

Est-ce que qu'ils font bien un sĂ©quençage de tout votre ADN qu'ils comparent dans son intĂ©gralitĂ© a la base de donnĂ©es ? Ou est-ce qu'ils ne seraient pas tentĂ©s de faire des Ă©conomies en temps de calcul et de juste prendre vos gĂšnes codants (qui sont une minoritĂ© de votre ADN) voir peut ĂȘtre mĂȘme simplement quelques gĂȘnes ?

Vous en savez quoi derriĂšre le pourcentage ?
Avatar de laplantevertent laplantevertent
Citation de Zebraman
Et si possible j’aimerais bien que tu expliques en quoi ça invalide la phylogenie humaine

Ça ne l'invalide pas vraiment que ça montre qu'elle ne reste que le produit d'une expĂ©rience qui a ses postulats et ses limites (financiĂšres notamment) .
Avatar de DevilMayCryBaby DevilMayCryBaby
Ça s appuie sur des hypothĂšses de continuitĂ© et de rĂ©pĂ©tition, mais ça se pose au mur des hasard gĂ©nĂ©tiques. Tu as pleins de sĂ©quences rĂ©pĂ©tĂ©es, comme les "AAA" qui peuvent apparaĂźtre en plusieurs exemplaires dans le gĂ©nome, rendant leur positionnement exact difficile.
Et mĂȘme si tu joues sur la distance gĂ©nĂ©tiques, t'as toujours ce qui est transposons/Ă©lĂ©ments transposables qui peuvent augmenter cette distance.
MĂȘme pour l assemblage "de novo" qui ne s'agit que de crĂ©er une version thĂ©orique du gĂ©nome, donc oĂč certaines dĂ©cisions doivent ĂȘtre prises en fonction de la probabilitĂ© des sĂ©quences, donc c'est un modĂšle par ce mĂȘme fait il simplifie le rĂ©el, et n'est pas toujours exact. Le pire Ă©tant les services de tests ADN qui utilisent souvent des mĂ©thodes simplifiĂ©es qui ne sĂ©quencent qu'une fraction du gĂ©nome (souvent les gĂšnes codants) donc ne capturent pas la complexitĂ© complĂšte du gĂ©nome.

AprÚs, faut voir ça comme un indicateur qui indique que tu as une probabilité non nulle d'avoir ce type d'origine (il faut aussi faire confiance en leur banque de donnée).
Mais sinon, j'imagine qu'ils essaient aussi de rechercher des séquences trÚs conservée avec des indicateurs spécifiques comme un certains promoteur à une certaine séquence codante + la séquence codante + la séquence usuelle la position à-20, etc...
Liste des sujets