
网问答>>机器学习数学基础一:监督学习核心概念
问题
机器学习数学基础一:监督学习核心概念
时间:2026-04-01 11:15:12
机器学习数学基础一:监督学习核心概念
最佳回答
监督学习的核心是利用标记数据训练模型,使其具备对未知数据的预测能力,其数学基础围绕模型、损失、风险等核心概念展开,具体内容如下:一、基础对象与统一记号数据:样本$(X, Y)$服从未知分布$mathcal{D}$,其中$X$为输入变量,$Y$为输出变量。例如在图像分类任务中,$X$是图像像素数据,$Y$是对应的类别标签。假设空间:用$mathcal{F}$表示,它是学习算法所有可能输出模型$f$的集合。学习算法最终会从该集合中输出一个模型$f in mathcal{F}$,比如在决策树算法中,假设空间就是所有可能的决策树结构的集合。损失函数:记为$ell(hat{y}, y)$,用于衡量模型预测值$hat{y}$与真实值$y$的差距。不同的任务会采用不同的损失函数,如在回归任务中常用平方损失函数$ell(hat{y}, y) = (hat{y} - y)^2$。二、期望风险(Expected Risk)定义:期望风险是模型在测试分布上的平均损失,公式为$mathcal{R}(f) = mathbb{E}_{(X,Y) sim mathcal{D}}[ell(f(X), Y)]$。它反映了模型在整个数据分布上的泛化能力。结构化要点对象与输入:学习器$f: mathcal{X} to mathcal{Y}$,数据由未知分布$mathcal{D}$生成,用损失$ell$度量误差。例如在语音识别任务中,$f$是将语音信号映射到文字的函数,$mathcal{D}$是各种语音数据的分布。解读:在“测试分布”上取期望,衡量$f$的泛化表现,与具体训练样本无关。这意味着期望风险关注的是模型在未见过的数据上的表现。与经验风险区别:$mathcal{R}(f)$是给定$f$与$mathcal{D}$时的确定值;经验风险$hat{mathcal{R}}(f)$是训练集上的样本平均,具有随机性。因为经验风险是基于有限的训练样本计算的,而期望风险考虑的是整个数据分布。噪声下的极限:最优预测器$f_$通常也有$mathcal{R}(f_) 0$,这是因为标签噪声不可完全消除。例如在医疗诊断数据中,可能存在诊断错误的情况,导致即使是最优模型也无法达到零期望风险。关键记忆点损失选取会改变$mathcal{R}$的语义,分类、回归等任务关注点不同。比如在分类任务中,更关注模型是否将样本正确分类;而在回归任务中,更关注预测值与真实值的接近程度。$mathcal{R}$面向未来样本,训练误差只是对它的估计。训练误差是基于训练样本计算的,而未来样本的分布可能与训练样本不同,所以训练误差不能完全代表模型的泛化能力。算法设计目标:让$mathcal{R}(hat{f})$接近$mathcal{R}(f_*)$,即让模型的期望风险尽可能接近最优预测器的期望风险。典型例子分类任务(0 - 1损失):损失函数为$ell(hat{y}, y) = mathbb{1}{hat{y} neq y}$,预测错误时损失为1,否则为0。记$eta(x) = mathbb{P}(Y = 1 mid X = x)$,则点态最小错误率为$r^(x) = min{eta(x), 1 - eta(x)}$,最优预测器为$f_(x) = mathbb{1}{eta(x) geq frac{1}{2}}$。例如若$eta(x) = 0.7$,则$f_*(x) = 1$,该点对$mathcal{R}$的贡献为$0.3$。回归任务(平方损失):损失函数为$ell(hat{y}, y) = (hat{y} - y)^2$。Bayes预测器为$f_(x) = mathbb{E}[Y mid X = x]$,且此时$mathcal{R}(f_) = mathbb{E}[text{Var}(Y mid X)]$。例如若$Y mid X = x sim mathcal{N}(mu(x), sigma^2)$,则该点的最小期望损失为$sigma^2$,如$sigma = 2$,贡献为$4$。概率输出任务(对数损失):损失函数为$ell(hat{p}, y) = -log hat{p}(y)$。最优为$hat{p}(cdot mid x) = mathbb{P}(Y = cdot mid X = x)$,点态最小值为条件熵$H(Y mid X = x) = -sum_{y} mathbb{P}(y mid x) log mathbb{P}(y mid x)$。三、经验风险(Empirical Risk)定义:基于训练集$S = {(x_i, y_i)}{i=1}^n$,经验风险是训练集上的平均损失,公式为$hat{mathcal{R}}(f) = frac{1}{n} sum{i=1}^n ell(f(x_i), y
时间:2026-04-01 11:15:16
本类最有帮助
- 关于贵巢床垫,听说其环保性能怎么样呢?
- 喜元帅瓷砖属于几线品牌?
- 长安的荔枝被禁播了么
- 这是边牧串吗?
- 云彩石地坪漆有什么优势?家里能用吗?
- 针对一般家庭装修,云彩石品牌提供怎样的组合方案?
- 听说藏天参和普通人参存在区别,为什么它的价格会更
- 叶良柱为什么选择给家具涂木蜡油而不是化学漆呢?
- 王浩输给过谁
- 小人全部滚。。。别想合好。。一个字穷?
- 包头包钢友谊宾馆酒店介绍
- 为啥应该感谢别人帮忙,但是有些人是要求别人感谢他
- 感恩是怎么来的,为啥有的人劝人目的是别人必须感谢
- 关于央心心理咨询,目前它的收费贵不贵呢?
- 关于央心心理咨询,第一次体验目前感觉如何?
- 对于央心心理咨询APP,收费标准是怎样的?
- 关于央心心理咨询,听说有线下机构分布吗?
- 二把手做好二把手
- 他对我有意思吗?
- 我喜欢你和能做我女朋友吗哪个正式有仪式感?
- 教师节写给教师的贺卡祝福贺词
- 以前很珍贵的应用,不小心删了,然后又忘了他的名字
- 以前很珍贵的赚钱应用,不小心删了,然后又忘了他的
- 最近麻烦事多,工作干不下去做不开心,新工作又不可
- 为什么我总是被用别人的咒骂语才能把自己隐藏到人群
- 一个未婚大龄女性,被一个已婚有子女的女人骂绝子绝
- 汽修兄弟们,有没有轻巧还贼拉带劲的电动扳手?
- 新国标电动车能解限速吗
- 光伏发电组成部分?
- 光伏板最多串联多少组?
- 光伏板之间怎么连接?
- 炫潮隐形车衣怎么样?
- 炫潮隐形车衣值得购买吗?
- 隐形车衣炫潮怎么样?
- 汽车解码器进不到系统是什么原因?
- 自由光喇叭什么牌子
- 炫潮品牌隐形车衣质量怎么样?
- 简单回答一下发动机电脑控制点火系统的工作过程
- 2014年A8发动机电脑版多少钱?
- 鉴别本田割草机真假识别
- 关于店商豹,它是怎么赚钱的?
- 当前银监会能否帮助协商还款
- 重庆丰都中学高考成绩亮眼
- 广东岭南职业技术学院有几个校区?地址分别在哪?
- 马明义平凉一中校长
- 广东岭南职业技术学院从广州天河区如何到达清远校区
- 长沙市通航中等职业学校是中专还是大专?可以学哪些
- 手机第一次充电充多长时间好?
- 怎么刷机?
- 王老师买粉笔用去29元7角,买墨水用去57元9角,她付
网问答为提供知识和解答各类疑难的平台,目标是做到有问必答解决您遇到的各类问题.本站内容均为网友发表,并不代表本站立场!
Copyright © 2008-2013 www.wangwenda.com All rights reserved.冀ICP备12000710号-1
投诉邮箱: