handsomestwei
Preview Image

Orange3可视化数据挖掘与机器学习工作台技术简介

Orange3可视化数据挖掘与机器学习工作台技术简介 Orange3 是由斯洛文尼亚 Biolab 维护的开源可视化数据挖掘与机器学习工作台:用户通过拖拽控件、画布连线搭建数据处理与建模流程,适合零编程或低编程门槛的教学与探索。本文从形态与内核、插件生态、开箱能力、GPL 许可、Trubar 汉化与二开路径等维度做技术梳理,便于与 KNIME、Jupyter、PyCaret 等工具对...

Preview Image

逻辑回归技术路线说明

逻辑回归技术路线说明 表格分类里,逻辑回归常作为可校准的线性基线,与树模型对照。sklearn 默认是 L2 正则(Ridge),交叉验证通常只搜正则强度 C。本文按罚项、估计方式、决策边界把常见路线分开,避免把「换求解器」误当成另一种模型。数字例子为虚构示意,非某次真实训练输出。 目录 1. L2(Ridge)的完整名称 2. 逻辑回归在做什么 3. 常见落...

Preview Image

通用NER技术简介

通用NER技术简介 命名实体识别(Named Entity Recognition, NER)是自然语言处理里的基础任务:从自由文本中找出「有类型的专名片段」,并标出它在原文中的起止位置。人名、地名、机构名是最经典的三类(CoNLL 评测常称 PER / LOC / ORG)。扩展后还可以包括时间、金额、产品、法规条款、基因、疾病等——类型集合由任务定义,不是技术本身固定的。 参...

Preview Image

中文医疗NER技术简介

中文医疗NER技术简介 病历、检查报告里的实体通常是疾病、症状、药品、检查、手术、部位等。NER 仍然只回答「文中写了哪些词」,不负责诊断对错、时间换算和国标编码。本文说明医疗文本的难点、标注类型,以及抽完 mention 之后临床流水线还要接什么。非诊疗建议,亦非编码实施手册。 目录 一、病历 NER 相对新闻文本的难点 二、常见实体类型 三、医疗数据来源与...

Preview Image

Leiden社区检测应用案例与建边范式简介

Leiden 社区检测应用案例与建边范式简介 Leiden 在公开竞赛与工业落地中,往往是解题手段而非赛题本身:先按业务规则建边构图,再用社区检测圈出「团伙 / 模块」,最后把社区号、中心性等喂给下游模型或业务系统。本文从 IEEE-CIS 欺诈团伙、单细胞 Leiden 特征工程等公开案例出发,归纳可复用的建图范式、数据例子与工程技巧,并说明弱共现边(如同批次事件、同场次)相对「同...

Preview Image

客群Index指数算法简介

客群 Index 指数算法简介 机器学习工程里说的「客群 Index / 客群指数」,最常指 PSI(Population Stability Index),中文常译为群体稳定性指数、人口稳定性指数或客群/样本稳定性指数:用分箱占比差量化两批样本分布漂移。广义上也包括 CSI、TGI、RFM 综合分等「把客群压成可监控数字」的方法。本文说明其作用、场景、原理、样本外/时间外应用范例与...