
特征提取与相似度计算
把对象收到同一向量空间再比远近,用于找相似样本或商品。说明归一化、加权余弦和稀疏特征处理,度量要和业务「像不像」对齐。

把对象收到同一向量空间再比远近,用于找相似样本或商品。说明归一化、加权余弦和稀疏特征处理,度量要和业务「像不像」对齐。

按问题选图:分布、关系、降维散点和簇结果各用一类。可视化是为了看见结构和异常,不是把所有图都画一遍。

按数据处理、训练框架、特征、解释、管理和可视化把 Python 工具摊开,说明各自解决哪一段。选型看任务和团队习惯,不必一次全上。

业务要问「为什么这么判」。对照增益排名、SHAP 和规则抽取:全局重要性和单条预测贡献不是一回事,不同算法的分数也不能直接横比。

说明推理中 KV Cache 占显存的含义与估算,对比 vLLM 与 SGLang 如何复用它,以及和首字延迟的关系,并给出小模型部署验证思路。

数据版本、模型归档和训练推理特征一致,比再涨一个点更决定能不能上线。还涉及并发锁、失败恢复、日志监控和测试边界。

特征是对原始信息的抽象,好列往往比换复杂模型更要紧。用关系型自动合成把多表聚合成矩阵,并说明常见手工变换为什么有效。

统计量、类别计数和时间拆分都是把原始字段变成模型能吃的数。按场景选函数并组合,而不是把所有变换一股脑堆上去。

把实验到上线、监控和回滚收成可重复流程,因为模型会随数据漂。相对软件运维多了数据版本和效果回归,不能只拷贝持续集成。

方差、相关、距离和优化是算法在算什么的语言。先搞清描述统计和线性代数在模型里对应哪一步,再去读具体公式会省事。