Prenez cette séquence
CGAAAATG
imaginez que vous la coupez en des morceaux de trois aléatoires
Ce qui vous donne des :
GCA
AAA
ATG
mais aussi CAA , AAT AAA (bis) ATG
Tous ces petits morceaux sont ce qui sort de votre séquenceur et que vous allez lire . Comment la reconstituez-vous.
Soit vous avez de la chance et quelqu'un l'a déjà fait pour vous et vous avez un génome de séquence . Il vous suffit "juste" de coller les morceaux au génome de référence un peu comme si vous faisiez ctr -f sur un texte.
Soit vous en avez et /ou vous ne voulez pas utiliser le génome déjà présent .
La vous devez faire un assemblage "de novo" en gros fait du puzzle vous remarquez que vous avez GCA CAA et AAA , donc un chemin probable GCA
CAA
AAA
Dans les faits, faites ça sur des extrémités de segments de 100 pb avec certaines précautions supplémentaires, mais c'est l'idée.
Donc déjà vous voyez que tous les "génome" sont en réalité des propositions théoriques ou l'on doit assumer la probabilité de certains chemins.
Mais du coup qu'est ce qui nous assure qu'il n'y a qu'un seul AAA ?
Reprenez depuis le début.
Vous avez toute une soupe de petits fragments de votre génome , pleins de GCA , pleins d’AAA, etc. Mais leurs quantités respectives ne sont pas nécessairement un bon indicateur de leur abondance dans le génome.
Reprenez la méthode du Puzle avec un génome comme si CGAAAAAAATG. Ou même CGAAAAAAAAAAAAAAAAAAAAAAAAAAAAATG si vous appliquez l’hypothèse de parcimonie vous en pouvez être sur que de AAA et AAA(bis) .
Mais la un jeune BoucledeBarnard naïf va débarquer pour me dire que l’hypothèse de parcimonie est par défaut la plus raisonnable , sauf que ... non pas en génétique.
Il existe plein de classe de mutations qui consistent en des multiplication de certaines parts du génome. Les éléments transposables notamment .
Et leur impact sur votre biologie sont négligeable , tous comme sur les algorithmes de classification.
Par ce que ça CGAAAATG et ça CGAAAATA c'est peut être relativement proche , mais ça CGAAAATG et ça CGAAAAAAAAAAAAAAAAAAAAAAATA beaucoup moins.
Sachant que vous pouvez très bien en acquérir au cours de l'évolution que les perdre.
C'est d'ailleurs pour ça qu'il faut distinguer la distance génétique des modifications de la distance d'édition (ex une plante domestique qui a dupliqué tout un chromosome par rapport a la sauvage )
Du coup pour pallier a ça les chercheurs séquencent régulièrement les génomes avec de nouvelles technologies qui permettent des cadres de lectures plus longs afin d'enfermer ses séquences répétées dans un fragment , quitte à combiner plus cadres de lectures pour pallier au manque de précision des plus grandes.
Rien que ca devrait calmer les envolés lyriques de Sekiin sur la pyhlogénie humaine
Mais passon au pire du pire , les boites comme my dna etc.
Quand elles vous vendent de retracer votre origine contre votre fichage dans des bases de données qui vont se faire hacker dans cinq ans est les 15 pygmées chopés dans le premier village chargé de dire a l'algo à quel point vous êtes éloignés d'eux sont au point ? Est-ce qu'ils ont bien été séquencés avec les dernières technologies ?
Est-ce que vous savez au moins sur quel échantillonnage de la population humaine ils se basent ?
Est-ce que qu'ils font bien un séquençage de tout votre ADN qu'ils comparent dans son intégralité a la base de données ? Ou est-ce qu'ils ne seraient pas tentés de faire des économies en temps de calcul et de juste prendre vos gènes codants (qui sont une minorité de votre ADN) voir peut être même simplement quelques gênes ?
Vous en savez quoi derrière le pourcentage ?
CGAAAATG
imaginez que vous la coupez en des morceaux de trois aléatoires
Ce qui vous donne des :
GCA
AAA
ATG
mais aussi CAA , AAT AAA (bis) ATG
Tous ces petits morceaux sont ce qui sort de votre séquenceur et que vous allez lire . Comment la reconstituez-vous.
Soit vous avez de la chance et quelqu'un l'a déjà fait pour vous et vous avez un génome de séquence . Il vous suffit "juste" de coller les morceaux au génome de référence un peu comme si vous faisiez ctr -f sur un texte.
Soit vous en avez et /ou vous ne voulez pas utiliser le génome déjà présent .
La vous devez faire un assemblage "de novo" en gros fait du puzzle vous remarquez que vous avez GCA CAA et AAA , donc un chemin probable GCA
CAA
AAA
Dans les faits, faites ça sur des extrémités de segments de 100 pb avec certaines précautions supplémentaires, mais c'est l'idée.
Donc déjà vous voyez que tous les "génome" sont en réalité des propositions théoriques ou l'on doit assumer la probabilité de certains chemins.
Mais du coup qu'est ce qui nous assure qu'il n'y a qu'un seul AAA ?
Reprenez depuis le début.
Vous avez toute une soupe de petits fragments de votre génome , pleins de GCA , pleins d’AAA, etc. Mais leurs quantités respectives ne sont pas nécessairement un bon indicateur de leur abondance dans le génome.
Reprenez la méthode du Puzle avec un génome comme si CGAAAAAAATG. Ou même CGAAAAAAAAAAAAAAAAAAAAAAAAAAAAATG si vous appliquez l’hypothèse de parcimonie vous en pouvez être sur que de AAA et AAA(bis) .
Mais la un jeune BoucledeBarnard naïf va débarquer pour me dire que l’hypothèse de parcimonie est par défaut la plus raisonnable , sauf que ... non pas en génétique.
Il existe plein de classe de mutations qui consistent en des multiplication de certaines parts du génome. Les éléments transposables notamment .
Et leur impact sur votre biologie sont négligeable , tous comme sur les algorithmes de classification.
Par ce que ça CGAAAATG et ça CGAAAATA c'est peut être relativement proche , mais ça CGAAAATG et ça CGAAAAAAAAAAAAAAAAAAAAAAATA beaucoup moins.
Sachant que vous pouvez très bien en acquérir au cours de l'évolution que les perdre.
C'est d'ailleurs pour ça qu'il faut distinguer la distance génétique des modifications de la distance d'édition (ex une plante domestique qui a dupliqué tout un chromosome par rapport a la sauvage )
Du coup pour pallier a ça les chercheurs séquencent régulièrement les génomes avec de nouvelles technologies qui permettent des cadres de lectures plus longs afin d'enfermer ses séquences répétées dans un fragment , quitte à combiner plus cadres de lectures pour pallier au manque de précision des plus grandes.
Rien que ca devrait calmer les envolés lyriques de Sekiin sur la pyhlogénie humaine
Mais passon au pire du pire , les boites comme my dna etc.
Quand elles vous vendent de retracer votre origine contre votre fichage dans des bases de données qui vont se faire hacker dans cinq ans est les 15 pygmées chopés dans le premier village chargé de dire a l'algo à quel point vous êtes éloignés d'eux sont au point ? Est-ce qu'ils ont bien été séquencés avec les dernières technologies ?
Est-ce que vous savez au moins sur quel échantillonnage de la population humaine ils se basent ?
Est-ce que qu'ils font bien un séquençage de tout votre ADN qu'ils comparent dans son intégralité a la base de données ? Ou est-ce qu'ils ne seraient pas tentés de faire des économies en temps de calcul et de juste prendre vos gènes codants (qui sont une minorité de votre ADN) voir peut être même simplement quelques gênes ?
Vous en savez quoi derrière le pourcentage ?