估计阅读时长: 10 分钟Github开源地址:https://github.com/xieguigang/flywire 本文是"果蝇赛博生命"三部曲的第三篇,也是高潮篇。前两篇我们讲清了脉冲神经元的"漏水桶"模型(第一篇),以及 FAFB-v783 连接组这张 5000 万条记录的全脑"通话清单"(第二篇)。今天,我们要做两件事:第一,给这只果蝇通电,看看她大脑里哪片区域在亮;第二,把贪吃蛇游戏接进她的大脑,让她自己玩。 然后——因为这篇文章写得足够长——我们顺便讨论一下人类的数字永生、缸中之脑、《黑客帝国》和《流浪地球 2》。坐稳了。 Attachments SNN-Snake • 208 KB • 10 click […]
估计阅读时长: 6 分钟Github开源地址:https://github.com/xieguigang/flywire 本文是"果蝇赛博生命"三部曲的第二篇。上一篇我们讲明白了脉冲神经网络(SNN)的原理:神经元是会漏水的桶,脉冲是它们唯一的语言。但一个悬而未决的问题是——桶和桶之间的水管,到底怎么接? 传统的做法是训练出来的。而我们的做法更"莽":直接把一只真实果蝇的全脑接线图下载下来,照着抄。 AttachmentsSort by:DefaultDateName Flywire-Home • 5 MB • 9 click 25.09.2026Connectome • 936 KB […]
估计阅读时长: 6 分钟Github开源地址:https://github.com/xieguigang/sciBASIC 本文是"果蝇赛博生命"三部曲的第一篇。我们不讲果蝇,也不讲贪吃蛇,只讲一件事:计算机是如何模仿你的大脑在"想事情"的。 放心,全文不需要任何机器学习背景,需要的只有高中数学,和一个愿意被比喻轰炸的开放心态。 AttachmentsSort by:DefaultDateName SNNResponse • 173 KB • 9 click 25.09.2026Capture • 262 KB […]
估计阅读时长: 17 分钟EC Number是国际酶学委员会(IUBMB)制定的一套酶分类编号体系,EC Number采用层级分类法,由4个数字组成,分别代表酶的大类、亚类、亚亚类和序号。例如,“EC 1.1.1.37”中,第一个“1”表示氧化还原酶大类;第二个“1”表示作用于CH-OH基团;第三个“1”表示以NAD+或NADP+为受体的酶;第四个“37”表示特定酶苹果酸脱氢酶。这种层次结构意味着EC编号蕴含了丰富的功能信息,包括酶催化的反应类型和底物/机制。将EC Number嵌入为向量,有助于我们利用机器学习模型进行功能预测、相似性分析等。 AttachmentsSort by:DefaultDateName Capture • 14 KB • 609 click 08.02.2026ec_numbers • […]
估计阅读时长: 11 分钟在将生物序列(如基因组或蛋白质序列)或文本数据转换为数值向量形式时,TF-IDF(Term Frequency-Inverse Document Frequency)和N-gram One-hot(又称Bag-of-n-grams)是两种经典且基础的文档嵌入算法。它们各自侧重于不同的特征提取方式,常被用于自然语言处理和生物信息学领域。 Attachments scatter_plot • 432 KB • 636 click 10.02.2026
Fig. 4 Weighted correlation network analysis (WGCNA) identifies IFNα-regulated mRNA and protein modules
估计阅读时长: 2 分钟Github项目:https://github.com/xieguigang/marker 本程序包是一个基于R语言的综合性机器学习工具集,专门设计用于生物标志物发现和疾病预测模型的构建。该工具整合了多种机器学习算法,提供了从数据预处理、特征选择到模型构建与验证的完整工作流程,特别适用于代谢组学、基因组学等高维生物数据的分析研究。在这个程序包中,主要是通过marker函数来封装了从数据与处理到模型建立的每一个步骤,主要将程序包划分为了以下的工作步骤模块: 数据加载和预处理 初始可视化(PCA图)和统计分析(线性模型、描述性统计) 特征选择(如果未提供预选特征,则使用LASSO、随机森林和SVM-RFE三种方法) 数据分割为训练集和测试集 模型集成训练(逻辑回归、XGBoost、随机森林) 结果可视化(ROC曲线、特征重要性、SHAP分析等) 大家在这里可以通过下面的技术路线图来了解在所编写的程序包中所涉及到的分析内容与步骤: 所主要涉及到的模型算法原理 机器学习方法 数学原理 使用场景 应用 LASSO回归 LASSO(Least […]
估计阅读时长: 2 分钟imports "clustering" from "MLkit"; require(graphics2D); multishapes = read.csv("./multishapes.csv"); [x, y] = list(multishapes[, "x"], multishapes[, "y"]); print(multishapes, […]
估计阅读时长: 9 分钟https://github.com/xieguigang/sciBASIC 在实际应用的机器学习方法里,GradientTree Boosting (GBDT)是一个在很多应用里都很出彩的技术。XGBoost是一套提升树可扩展的机器学习系统。XGBoost全名叫(eXtreme Gradient Boosting)极端梯度提升。它是大规模并行boosted tree的工具,XGBoost 所应用的算法就是 GBDT(gradient boosting decision tree)的改进,既可以用于分类也可以用于回归问题中。 AttachmentsSort by:DefaultDateName ROC • […]
Visual a KDtree
估计阅读时长: 8 分钟https://github.com/xieguigang/sciBASIC 在进行无监督聚类分析的方法之中,我们在算法代码之中一般会遇到求解与某一个样本数据点最相似的数据点的计算过程。对于这个计算过程,一般而言我们是基于欧几里得距离来完成的。 AttachmentsSort by:DefaultDateName Visual a KDtree Search • 274 KB • 1181 click 10.08.2021Visual a […]
估计阅读时长: 8 分钟https://github.com/rsharp-lang/R-sharp 对于0,1两类分类问题,一些分类器得到的结果往往不是0,1这样的标签。如神经网络得到诸如0.5,0.8这样的分类结果。这时,我们人为取一个阈值,比如0.4,那么小于0.4的归为0类,大于等于0.4的归为1类,可以得到一个分类结果。同样,这个阈值我们可以取0.1或0.2等等。 AttachmentsSort by:DefaultDateName ROC • 221 KB • 1230 click 28.06.2021Roccurves • 39 KB • […]
博客文章
October 2026
S M T W T F S
 123
45678910
11121314151617
18192021222324
25262728293031
  1. […] 我们在基于前面所论述的《通过diamond软件进行blastp搜索》对大规模的基因组数据进行了代谢酶的EC number的注释以及按照文章《基因组功能注释(EC Number)的向量化嵌入》的方法,得到了一个比较大的基因组代谢酶TF-IDF嵌入丰度矩阵后,如果将这里所得到的嵌入结果矩阵中的基因组,基于Family层级的物种分类分组看作为单细胞转录数据中的细胞分群结果,能否基于单细胞数据分析方法来分析和可视化我的基因组功能嵌入的结果矩阵呢? […]

  2. […] 我们在基于前面所论述的《通过diamond软件进行blastp搜索》对大规模的基因组数据进行了代谢酶的EC number的注释以及按照文章《基因组功能注释(EC Number)的向量化嵌入》的方法,得到了一个比较大的基因组代谢酶TF-IDF嵌入丰度矩阵后,如果将这里所得到的嵌入结果矩阵中的基因组,基于Family层级的物种分类分组看作为单细胞转录数据中的细胞分群结果,能否基于单细胞数据分析方法来分析和可视化我的基因组功能嵌入的结果矩阵呢? […]

  3. […] 在前面的一篇《基因组功能注释(EC Number)的向量化嵌入》博客文章中,针对所注释得到的微生物基因组代谢信息,进行基于TF-IDF的向量化嵌入之后。为了可视化向量化嵌入的效果,通过UMAP进行降维,然后基于降维的结果进行散点图可视化。通过散点图可视化可以发现向量化的嵌入结果可以比较好的将不同物种分类来源的微生物基因组区分开来。 […]