handsomestwei
Preview Image

Orange3可视化数据挖掘与机器学习工作台技术简介

Orange3可视化数据挖掘与机器学习工作台技术简介 Orange3 是由斯洛文尼亚 Biolab 维护的开源可视化数据挖掘与机器学习工作台:用户通过拖拽控件、画布连线搭建数据处理与建模流程,适合零编程或低编程门槛的教学与探索。本文从形态与内核、插件生态、开箱能力、GPL 许可、Trubar 汉化与二开路径等维度做技术梳理,便于与 KNIME、Jupyter、PyCaret 等工具对...

Preview Image

逻辑回归技术路线说明

逻辑回归技术路线说明 表格分类里,逻辑回归常作为可校准的线性基线,与树模型对照。sklearn 默认是 L2 正则(Ridge),交叉验证通常只搜正则强度 C。本文按罚项、估计方式、决策边界把常见路线分开,避免把「换求解器」误当成另一种模型。数字例子为虚构示意,非某次真实训练输出。 目录 1. L2(Ridge)的完整名称 2. 逻辑回归在做什么 3. 常见落...

Preview Image

通用NER技术简介

通用NER技术简介 命名实体识别(Named Entity Recognition, NER)是自然语言处理里的基础任务:从自由文本中找出「有类型的专名片段」,并标出它在原文中的起止位置。人名、地名、机构名是最经典的三类(CoNLL 评测常称 PER / LOC / ORG)。扩展后还可以包括时间、金额、产品、法规条款、基因、疾病等——类型集合由任务定义,不是技术本身固定的。 参...

Preview Image

中文医疗NER技术简介

中文医疗NER技术简介 病历、检查报告里的实体通常是疾病、症状、药品、检查、手术、部位等。NER 仍然只回答「文中写了哪些词」,不负责诊断对错、时间换算和国标编码。本文说明医疗文本的难点、标注类型,以及抽完 mention 之后临床流水线还要接什么。非诊疗建议,亦非编码实施手册。 目录 一、病历 NER 相对新闻文本的难点 二、常见实体类型 三、医疗数据来源与...