别人交付给你的分析,怎么检查
不用懂编程也能做的十条检查,一个下午就能判断这份单细胞分析能不能扛住审稿。
你付了钱,收到一堆图,而你自己没法把它们重算一遍。下面这些检查不需要写代码,能抓住绝大多数问题。
1. 要质控背后的数字
按样本给:过滤前后的细胞数、用的阈值。任何样本掉了 20% 以上,应该有解释。如果这些数字根本拿不出来,说明质控没被记录——通常也意味着没被认真看过。
2. 看阈值适不适合你的组织
把 5% 的线粒体上限套到心脏、肝脏、肌肉上,删掉的是真细胞。如果你的组织线粒体本来就多,而报告用的是教程默认值,要求用数据驱动的阈值重跑。
3. 问双细胞是怎么处理的
可接受的回答会说出工具名(scDblFinder / DoubletFinder / Scrublet)和比例。"我们过滤掉了基因数过多的细胞"不是双细胞处理——那个过滤删掉的是大而健康的细胞,双细胞基本都留着。
4. 找有没有独立的注释验证
细胞类型标签应该有不止一条证据:marker 加上参考数据集的自动注释,而且最好是在看不到人工标签的情况下跑的。这里是一份做了盲测复核的样品。只有 marker 的话,标签就是一个人的判断。
5. 追问差异表达的样本量
问一句:这个检验里的样本量是多少?如果回答是细胞数而不是受试者数,那些 p 值就不是图上暗示的那个意思。为什么,一页说清。
6. 批次是被建模了还是被抹掉了
整合是给可视化和聚类用的。统计应该在未校正的 counts 上做,把批次作为协变量放进模型。在整合后的值上做检验会抬高置信度,而且事后很难看出来。
7. 拿已知生物学对一下
挑一件你本来就知道是真的事——某个必然存在的 marker、某个必然存在的细胞群、某个已确立的处理效应——确认这份分析能重现它。连已知的都重现不了,未知的就更不能信。
8. 试着重算一张图
要来脚本,让学生重跑其中一张图。如果做不到,下次审稿人追问时你只能再付一次钱。
9. 用审稿人的眼光读方法学段落
工具名、版本、参数、过滤标准、统计模型。任何含糊的地方,都会变成一条审稿意见。
10. 看缺了什么
没提环境 RNA、没有按样本的质控表、没有双细胞率、没有说明统计单位——每一处缺失,都是某个决定被做了却没被记录的地方。这就是"能站住的分析"和"一堆图"之间的区别。
如果一份交付物在上面多条都不合格,而截止日又近,独立重跑一遍通常比来回争论更快也更便宜——这正是"第二意见重跑"那一档的用途。