Prenez cette séquence
CGAAAATG
imaginez que vous la coupez en des morceaux de trois aléatoires
Ce qui vous donne des :
GCA
AAA
ATG
mais aussi CAA , AAT AAA (bis) ATG
Tous ces petits morceaux sont ce qui sort de votre séquenceur et que vous allez lire . Comment la reconstituez-vous.
Soit vous avez de la chance et quelqu'un l'a déjà fait pour vous et vous avez un génome de séquence . Il vous suffit "juste" de coller les morceaux au génome de référence un peu comme si vous faisiez ctr -f sur un texte.
Soit vous en avez et /ou vous ne voulez pas utiliser le génome déjà présent .
La vous devez faire un assemblage "de novo" en gros fait du puzzle vous remarquez que vous avez GCA CAA et AAA , donc un chemin probable GCA
CAA
AAA
Dans les faits, faites ça sur des extrémités de segments de 100 pb avec certaines précautions supplémentaires, mais c'est l'idée.
Donc déjà vous voyez que tous les "génome" sont en réalité des propositions théoriques ou l'on doit assumer la probabilité de certains chemins.
Mais du coup qu'est ce qui nous assure qu'il n'y a qu'un seul AAA ?
Reprenez depuis le début.
Vous avez toute une soupe de petits fragments de votre gĂ©nome , pleins de GCA , pleins dâAAA, etc. Mais leurs quantitĂ©s respectives ne sont pas nĂ©cessairement un bon indicateur de leur abondance dans le gĂ©nome.
Reprenez la mĂ©thode du Puzle avec un gĂ©nome comme si CGAAAAAAATG. Ou mĂȘme CGAAAAAAAAAAAAAAAAAAAAAAAAAAAAATG si vous appliquez lâhypothĂšse de parcimonie vous en pouvez ĂȘtre sur que de AAA et AAA(bis) .
Mais la un jeune BoucledeBarnard naĂŻf va dĂ©barquer pour me dire que lâhypothĂšse de parcimonie est par dĂ©faut la plus raisonnable , sauf que ... non pas en gĂ©nĂ©tique.
Il existe plein de classe de mutations qui consistent en des multiplication de certaines parts du génome. Les éléments transposables notamment .
Et leur impact sur votre biologie sont négligeable , tous comme sur les algorithmes de classification.
Par ce que ça CGAAAATG et ça CGAAAATA c'est peut ĂȘtre relativement proche , mais ça CGAAAATG et ça CGAAAAAAAAAAAAAAAAAAAAAAATA beaucoup moins.
Sachant que vous pouvez trÚs bien en acquérir au cours de l'évolution que les perdre.
C'est d'ailleurs pour ça qu'il faut distinguer la distance génétique des modifications de la distance d'édition (ex une plante domestique qui a dupliqué tout un chromosome par rapport a la sauvage )
Du coup pour pallier a ça les chercheurs séquencent réguliÚrement les génomes avec de nouvelles technologies qui permettent des cadres de lectures plus longs afin d'enfermer ses séquences répétées dans un fragment , quitte à combiner plus cadres de lectures pour pallier au manque de précision des plus grandes.
Rien que ca devrait calmer les envolés lyriques de Sekiin sur la pyhlogénie humaine
Mais passon au pire du pire , les boites comme my dna etc.
Quand elles vous vendent de retracer votre origine contre votre fichage dans des bases de donnĂ©es qui vont se faire hacker dans cinq ans est les 15 pygmĂ©es chopĂ©s dans le premier village chargĂ© de dire a l'algo Ă quel point vous ĂȘtes Ă©loignĂ©s d'eux sont au point ? Est-ce qu'ils ont bien Ă©tĂ© sĂ©quencĂ©s avec les derniĂšres technologies ?
Est-ce que vous savez au moins sur quel échantillonnage de la population humaine ils se basent ?
Est-ce que qu'ils font bien un sĂ©quençage de tout votre ADN qu'ils comparent dans son intĂ©gralitĂ© a la base de donnĂ©es ? Ou est-ce qu'ils ne seraient pas tentĂ©s de faire des Ă©conomies en temps de calcul et de juste prendre vos gĂšnes codants (qui sont une minoritĂ© de votre ADN) voir peut ĂȘtre mĂȘme simplement quelques gĂȘnes ?
Vous en savez quoi derriĂšre le pourcentage ?
CGAAAATG
imaginez que vous la coupez en des morceaux de trois aléatoires
Ce qui vous donne des :
GCA
AAA
ATG
mais aussi CAA , AAT AAA (bis) ATG
Tous ces petits morceaux sont ce qui sort de votre séquenceur et que vous allez lire . Comment la reconstituez-vous.
Soit vous avez de la chance et quelqu'un l'a déjà fait pour vous et vous avez un génome de séquence . Il vous suffit "juste" de coller les morceaux au génome de référence un peu comme si vous faisiez ctr -f sur un texte.
Soit vous en avez et /ou vous ne voulez pas utiliser le génome déjà présent .
La vous devez faire un assemblage "de novo" en gros fait du puzzle vous remarquez que vous avez GCA CAA et AAA , donc un chemin probable GCA
CAA
AAA
Dans les faits, faites ça sur des extrémités de segments de 100 pb avec certaines précautions supplémentaires, mais c'est l'idée.
Donc déjà vous voyez que tous les "génome" sont en réalité des propositions théoriques ou l'on doit assumer la probabilité de certains chemins.
Mais du coup qu'est ce qui nous assure qu'il n'y a qu'un seul AAA ?
Reprenez depuis le début.
Vous avez toute une soupe de petits fragments de votre gĂ©nome , pleins de GCA , pleins dâAAA, etc. Mais leurs quantitĂ©s respectives ne sont pas nĂ©cessairement un bon indicateur de leur abondance dans le gĂ©nome.
Reprenez la mĂ©thode du Puzle avec un gĂ©nome comme si CGAAAAAAATG. Ou mĂȘme CGAAAAAAAAAAAAAAAAAAAAAAAAAAAAATG si vous appliquez lâhypothĂšse de parcimonie vous en pouvez ĂȘtre sur que de AAA et AAA(bis) .
Mais la un jeune BoucledeBarnard naĂŻf va dĂ©barquer pour me dire que lâhypothĂšse de parcimonie est par dĂ©faut la plus raisonnable , sauf que ... non pas en gĂ©nĂ©tique.
Il existe plein de classe de mutations qui consistent en des multiplication de certaines parts du génome. Les éléments transposables notamment .
Et leur impact sur votre biologie sont négligeable , tous comme sur les algorithmes de classification.
Par ce que ça CGAAAATG et ça CGAAAATA c'est peut ĂȘtre relativement proche , mais ça CGAAAATG et ça CGAAAAAAAAAAAAAAAAAAAAAAATA beaucoup moins.
Sachant que vous pouvez trÚs bien en acquérir au cours de l'évolution que les perdre.
C'est d'ailleurs pour ça qu'il faut distinguer la distance génétique des modifications de la distance d'édition (ex une plante domestique qui a dupliqué tout un chromosome par rapport a la sauvage )
Du coup pour pallier a ça les chercheurs séquencent réguliÚrement les génomes avec de nouvelles technologies qui permettent des cadres de lectures plus longs afin d'enfermer ses séquences répétées dans un fragment , quitte à combiner plus cadres de lectures pour pallier au manque de précision des plus grandes.
Rien que ca devrait calmer les envolés lyriques de Sekiin sur la pyhlogénie humaine
Mais passon au pire du pire , les boites comme my dna etc.
Quand elles vous vendent de retracer votre origine contre votre fichage dans des bases de donnĂ©es qui vont se faire hacker dans cinq ans est les 15 pygmĂ©es chopĂ©s dans le premier village chargĂ© de dire a l'algo Ă quel point vous ĂȘtes Ă©loignĂ©s d'eux sont au point ? Est-ce qu'ils ont bien Ă©tĂ© sĂ©quencĂ©s avec les derniĂšres technologies ?
Est-ce que vous savez au moins sur quel échantillonnage de la population humaine ils se basent ?
Est-ce que qu'ils font bien un sĂ©quençage de tout votre ADN qu'ils comparent dans son intĂ©gralitĂ© a la base de donnĂ©es ? Ou est-ce qu'ils ne seraient pas tentĂ©s de faire des Ă©conomies en temps de calcul et de juste prendre vos gĂšnes codants (qui sont une minoritĂ© de votre ADN) voir peut ĂȘtre mĂȘme simplement quelques gĂȘnes ?
Vous en savez quoi derriĂšre le pourcentage ?








