人和动物DNA匹配率怎么算:按序列口径看人狗相似度(2024年)
王小丫
发布于 扬子晚报
+关注
人和动物的DNA没有一个适用于所有物种、所有研究的统一匹配率。计算时,必须先说明比较的是哪些DNA片段,以及“匹配”按什么规则计数。若比较的是对齐后的碱基序列,常用口径是“相同碱基数÷参与比较的碱基数×100%”;若统计的是双方有多少基因能找到对应基因,得到的则是基因对应比例,不能直接称为整套DNA的匹配率。
先确定统计口径:比碱基,还是比基因
碱基序列一致率比较的是DNA序列中的A、T、C、G。将两段可比序列排列对齐后,逐位统计相同碱基,结果反映所选序列在该口径下有多一致。它适合描述特定基因、特定区域,或经过筛选后能够相互比较的基因组区域。
基因对应比例则统计一方的基因中,有多少能在另一方找到同源或对应基因。它回答的是“有多少基因可以找到对应对象”,并不表示这些基因的碱基有同样比例完全相同。即使多数基因都能找到对应基因,具体序列仍可能存在不少差异。
此外,序列一致率、序列覆盖范围和基因对应比例是不同指标。覆盖范围表示有多少序列成功进入比较;一致率表示进入比较的序列有多少位置相同。只报告一个百分比而不交代指标,容易把不同含义混为一谈。
碱基匹配率的计算步骤
- 确定比较对象。写清楚动物物种,以及比较的是某个基因、某段DNA,还是基因组中经过筛选的区域。“人和动物”范围太宽,不同物种的结果不能共用一个数值。
- 选定可比序列。需要找出两者中能够对应比较的同源区域,并用序列比对将相应位置排列起来。若把无法对应的区域、重复序列等纳入或排除,计算结果会发生变化。
- 规定缺口如何计数。插入或缺失会让比对结果出现空位?梢灾煌臣屏奖叨加屑罨奈恢,也可以把含空位的位置视为不匹配并纳入分母。两种做法都能计算,但必须明确说明采用哪一种。
- 按公式计算并报告范围。说明相同位置数、分母如何确定,以及序列覆盖范围。若多个片段长度不同,通常应汇总相同碱基总数和可比位置总数后计算,不能不加权地简单平均每个片段的百分比。
公式:碱基一致率=相同碱基位置数÷纳入统计的比对位置数×100%。
示例:缺口规则不同,百分比也会变
假设某段人类DNA与一种动物的对应序列比对后共有1000个比对位置,其中50个位置含有插入或缺失,剩下950个两边都有碱基的位置中,有870个碱基相同。
- 若排除含缺口的位置:870÷950×100%≈91.6%。
- 若把全部1000个比对位置都放入分母,并将含缺口位置视作不匹配:870÷1000×100%=87%。
两个结果来自同一组比对数据,差别在于分母口径,而不是DNA突然变得更相似或更不同。实际研究还需要交代所用物种样本、基因组版本、筛选规则和比对范围,读者才能判断百分比具体代表什么。
怎样看待“人和狗DNA匹配率约84%”
单独看到“约84%”无法判断它是全基因组碱基一致率、某类基因的对应比例,还是对特定区域进行比对后得到的结果。若没有指出比较序列、计算方法和分母,就不能把它当作人和狗整套DNA的固定匹配率。类似数字可能描述的是某一研究口径,不应直接套用于其他物种或其他统计方式。
因此,引用人和狗,或人和其他动物的相似度数据时,最好同时查看三个信息:比较的对象是什么、百分比怎么算、覆盖了哪些序列。如果资料只写“DNA相似度”而没有这些说明,更稳妥的做法是把数字视为口径未明的概括,不据此推断两种生物整体有多少DNA完全相同。
让结果可比较的报告方式
一个清楚的结果至少应写明物种和数据来源、比较区域、序列比对与筛选规则、缺口处理方式,并分别给出一致率和覆盖范围。若统计的是基因,则应称为“基因对应比例”或明确说明所用基因集合;若统计的是碱基,则使用“序列一致率”,并交代分母。这样不同研究的数字才有比较基础,也能避免把局部基因结果误读成整套基因组的统一比例。
简言之,人和动物DNA匹配率的计算核心不是寻找一个通用百分比,而是先确定可比序列与计数口径,再按相同碱基数除以纳入统计的位置数?诰肚宄,数字才有明确含义。
免责声明:本内容来自腾讯平台创作者,不代表腾讯新闻或腾讯网的观点和立场。