Ça s appuie sur des hypothèses de continuité et de répétition, mais ça se pose au mur des hasard génétiques. Tu as pleins de séquences répétées, comme les "AAA" qui peuvent apparaître en plusieurs exemplaires dans le génome, rendant leur positionnement exact difficile.
Et même si tu joues sur la distance génétiques, t'as toujours ce qui est transposons/éléments transposables qui peuvent augmenter cette distance.
Même pour l assemblage "de novo" qui ne s'agit que de créer une version théorique du génome, donc où certaines décisions doivent être prises en fonction de la probabilité des séquences, donc c'est un modèle par ce même fait il simplifie le réel, et n'est pas toujours exact. Le pire étant les services de tests ADN qui utilisent souvent des méthodes simplifiées qui ne séquencent qu'une fraction du génome (souvent les gènes codants) donc ne capturent pas la complexité complète du génome.
Après, faut voir ça comme un indicateur qui indique que tu as une probabilité non nulle d'avoir ce type d'origine (il faut aussi faire confiance en leur banque de donnée).
Mais sinon, j'imagine qu'ils essaient aussi de rechercher des séquences très conservée avec des indicateurs spécifiques comme un certains promoteur à une certaine séquence codante + la séquence codante + la séquence usuelle la position à-20, etc...
Et même si tu joues sur la distance génétiques, t'as toujours ce qui est transposons/éléments transposables qui peuvent augmenter cette distance.
Même pour l assemblage "de novo" qui ne s'agit que de créer une version théorique du génome, donc où certaines décisions doivent être prises en fonction de la probabilité des séquences, donc c'est un modèle par ce même fait il simplifie le réel, et n'est pas toujours exact. Le pire étant les services de tests ADN qui utilisent souvent des méthodes simplifiées qui ne séquencent qu'une fraction du génome (souvent les gènes codants) donc ne capturent pas la complexité complète du génome.
Après, faut voir ça comme un indicateur qui indique que tu as une probabilité non nulle d'avoir ce type d'origine (il faut aussi faire confiance en leur banque de donnée).
Mais sinon, j'imagine qu'ils essaient aussi de rechercher des séquences très conservée avec des indicateurs spécifiques comme un certains promoteur à une certaine séquence codante + la séquence codante + la séquence usuelle la position à-20, etc...