Ran Wei/数学系列
English
计算机科学与人工智能的数学基础 — Ran Wei

随机变量、分布与变换

推离散质量与累积分布,区分密度及概率,构造分位抽样,变换时保全部原像或逆坐标因子。

10 小时4 个时段3 个实验12 道练习与 2 道拓展10 道自测题

完成后你能够

  • 通过事件原像区分映射、实现与分布。
  • 推Bernoulli、类别、二项、几何,并写Poisson假设。
  • 用CDF跳及端点;AI额外归一密度并保混合原子。
  • 构造广义分位和明确端点的逆抽样。
  • 合离散原像;AI推绝对逆因子及多分支。
  • 选机制、支持、参数约定,诊断数值及模型错误。

开始之前

所有路线需模块 21。标记连续AI分支需模块 17;CS用离散衔接及等时练习替代。实验仅需Python标准库。

目录

学习计划

10 小时

时间包含练习,是估计值;可按需要拆分时段。可选拓展练习额外需要 35 分钟。进度保存在当前浏览器,中英文版本共享。

1

随机变量先是函数 然后才有观察值

概率模型赋予事件质量,随机变量则把结果映射到数值。本课推离散分布,区分密度与概率,构造分布函数和分位数,变换时保留原像及Jacobian因子。每个模型都对应生成过程和明确支持,而非只因曲线熟悉就选用。

检索检查: 模块 21 提供事件、条件与独立。连续AI分支: 密度、连续抽样推导及变量替换需要模块 17。CS路线学习全部离散材料,用第3节的离散衔接,省略实验及练习中标记连续的部分,以同样时间练习离散CDF和变换。

2

结果映射 分布与累积概率

实随机变量X把Ω映射到R。有限模型任意此映射都有效;一般可测性要求所有实t的{ω:X(ω)≤t}为事件。实验发生前,随机变量是完整函数;实现数值x=X(ω)是观察,ω可能含比x更多的信息。两硬币映射到正面数时,HT和TH都变成1。因此结果、变量、观察是不同对象。

X的分布通过原像赋值集概率:P(X∈S)=P({ω:X(ω)∈S})。不同映射或实验可能同分布;相同显示值也可在不同模型有不同质量。离散PMF p_X(x)=P(X=x)非负,在可数支持上总和1。这里离散支持指正质量值,其外质量零。连续分布描述支持区间或邻域,因为单点质量零。

CDF F_X(t)=P(X≤t)对离散、连续、混合均存在。事件随t增加,故F非减;由嵌套事件概率连续性,负正无穷极限为0、1。右连续:t_k↓t时{X≤t_k}递减到{X≤t},模块21给F(t_k)→F(t)。左极限F(t−)=P(X<t)由从下趋近阈值得到。因此t处跳跃恰为P(X=t)。

例题详解
多对一观察映射产生非均匀计数

两独立公平硬币四个有序结果各1/4。X数正面,则p(0)=1/4、p(1)=1/2、p(2)=1/4。CDF在0以下为0,[0,1)为1/4,[1,2)为3/4,[2,∞)为1。三计数不均匀。F(1)=3/4包含1处质量,F(1−)=1/4不包含。

任意a<b,P(a<X≤b)=F(b)−F(a)。左严格、右包含在原子处重要。P(a≤X≤b)=F(b)−F(a−),P(X>b)=1−F(b),P(X≥b)=1−F(b−)。这些由不交事件分解得到,不假定密度。无端点质量的连续分布部分区别数值相同,离散不可悄悄丢端点。即使生成分布连续,有限经验CDF也在观测处跳跃。

P(a<X≤b)=FX(b)−FX(a),P(X=t)=FX(t)−FX(t−).P(a<X\leq b)=F_X(b)-F_X(a),\qquad P(X=t)=F_X(t)-F_X(t^-).

有限表按值排序后累加质量,保留≤约定。若用斜线连接CDF跳跃端点,会误示没有质量处也改变概率。PMF条与CDF阶梯表示不同量:一是某值质量,一是到阈值累积概率。坐标需明确对象,变换后合并质量并重新按输出值排序。

边缘分布不指定另一变量的联合依赖。两变量都可为公平Bernoulli,却可能相同、相反或独立,边缘PMF相同而联合事件不同。下课讨论联合和期望;现在不能没有模块21的独立假设就乘边缘质量。已有变量的函数也与该变量保持依赖,即使输出分布有熟悉名称。

分布也不同于表示精度。把连续测量舍入到箱中产生离散报告变量,各箱质量是原区间概率。传感器按十分位报告.3可能代表一段输入而非单点.3。比较精确点观察与密度前需写测量及平局约定;重复舍入标签不单独证明底层物理量有原子。

两硬币结果到正面计数四个等可能结果映到零一二,两个原像合成计数一的质量二分之一。随机变量合并原像TT : 1/4HT : 1/4TH : 1/4HH : 1/4X=0; p=1/4X=1; p=1/2X=2; p=1/4计数1收HT与TH;F(1)=3/4,F(1−)=1/4。
图 22.1

四结果映射到三正面计数,中间值收两个原像;PMF质量与右连续CDF阶梯编码同一分布。

检验理解

实现数值就是随机变量吗?三种可能计数为何不均匀?CDF在t跳多少?

查看答案

变量是映射,数是实现输出。计数1收两个等可能结果,其余各收一个。跳跃F(t)−F(t−)=P(X=t)。

3

离散分布族及其生成实验

Bernoulli取0、1,概率1−p、p,0≤p≤1,常为事件指示。端点p=0、1是有效退化分布。Categorical取k标签,质量p_i≥0和1;用整数编码不让标签数值距离有意义。抽到的类下标是类别变量,预测概率向量则描述分布而非实现类别。

Binomial数固定n个独立、相同p的Bernoulli试验成功数。k=0,…,n时,选择k个成功位置有comb(n,k)种,每模式质量p^k(1−p)^{n−k},所以PMF为两者乘积。不交成功数事件划分全部模式,或二项式定理证明归一。p=0、1直接处理,避免数值0^0歧义。独立、共同p、固定n都是模型假设,不从观察计数自动得来。

例题详解
二项尾概率是事件质量和

n=5、p=2/5时,P(X≥3)=Σ_{k=3}^5 comb(5,k)(2/5)^k(3/5)^{5−k}=992/3125=.31744。≥包含3,用1−F(3)会漏掉它;整数支持正确补为1−F(2)。实验1精确算全部质量及累积,不用模拟或正态近似核查有限尾。

几何试验数T是独立重复、固定0<p≤1的首次成功下标,支持从1,P(T=k)=(1−p)^{k−1}p。失败数约定G=T−1从0,P(G=k)=(1−p)^k p,必须注明。0<p<1时前K质量和1−(1−p)^K,余尾(1−p)^K。p=1时T=1;p=0无有限首次成功,因此有限值几何PMF不归一。

尾P(T>m)=(1−p)^m给无记忆:条件质量正时P(T>m+n|T>m)=(1−p)^n。独立同分布尝试下,已失败m次不改变等待机制。失败后成功率变化的系统不符合几何故事;重复尝试可依赖或危险率变化,等待计数本身不建立无记忆及恒p。

Poisson为非负整数计数,参数λ≥0,PMF exp(−λ)λ^k/k!,k=0,1,…;λ=0解作零点质量1。归一用指数级数恒等式Σλ^k/k!=exp(λ),离散路线可接受该陈述,无需模块16微积分证明。常见机制是独立增量、恒事件率的齐次过程在固定区间计数,λ为率乘时长。它不自动适用于每个计数、聚集过程或变率区间。

λ=2时零质量exp(−2)≈.135335,一质量2exp(−2)≈.270671。0至K有限表总和小于1因为漏正尾,不是模型无效。归一截表改变为X≤K的条件模型,实验1明确报告余质量。大参数直接幂及阶乘可溢出,后续稳定对数处理算术,但支持和生成假设不变。

从固定有限集无放回抽样通常给超几何而非二项计数,移除物品使后续成功率改变。抽样比例小可考虑二项近似,但必须注明近似及足够误差标准。命名分布是机制的紧凑描述,仅匹配平均计数或直方图形状不足以建立全部假设。

检验理解

二项计数有哪些假设?几何试验支持从哪里?有限Poisson表必须恰和1吗?

查看答案

固定n、独立尝试及共同p。试验从1,失败数从0。有限Poisson前缀漏无限尾,归一会改目标为条件截断。

4

连续密度与明确的离散路线衔接

CS衔接: PMF直接给离散值概率,CDF用≤累加。练习端点恒等式及上面的类别、二项、几何例。本节余下和全部标记连续计算需要模块17;CS可省略,继续离散分位数及变换。这不是给离散路线增加隐含微积分先修。

连续AI分支: 绝对连续分布有非负密度f_X,全R积分1,P(a<X≤b)=∫_a^b f_X(x)dx。PDF是高度,不是事件概率,可超过1,单位为x单位的倒数。改一个点的密度不改变概率。即使密度正,连续点概率零。并非全部分布都有普通PDF:离散原子及混合模型需保留点质量。

Uniform(a,b)、a<b在(a,b)密度1/(b−a),外零,内部CDF线性。端点密度版本不改积分。指数率λ>0在x≥0密度λexp(−λx),负值零,CDF为1−exp(−λx),积分1。率λ和尺度1/λ是不同约定:前者倒数时间、后者时间。指数尾乘积给正条件尾下无记忆,描述恒率模型,并非全部等待时间必有性质。

例题详解
密度大于一仍可有零单点概率

指数率2的选定版本f(0)=2,P(X=0)=0,P(0<X≤.1)=1−exp(−.2)≈.181269。短区间积分才给概率;高度乘宽仅在密度足够稳定时近似。2既非概率,也不违反归一。

Gaussian N(μ,σ²)、σ>0在全R密度exp(−(x−μ)²/(2σ²))/(σ√(2π))。归一用经典Gaussian积分∫exp(−z²/2)dz=√(2π),本课陈述事实,不假装由初等原函数规则证明。z=(x−μ)/σ再给尺度因子。CDF通常无初等闭式,以数值或特殊函数求。σ=0是μ处退化原子,不是代入除零公式。

Laplace(μ,b)、b>0密度exp(−|x−μ|/b)/(2b)。在μ分割,两指数半各积分1/2。CDF在μ下为exp((x−μ)/b)/2,上为1−exp(−(x−μ)/b)/2。峰有折角,指数尾比Gaussian重,选为噪声是机制假设。对称或少量中心观察不唯一确定分布族。

混合模型可在零放.3质量,再将.7均匀放(0,1)。CDF零以下0,零跳至.3,内部.3+.7t,1处达到1。内部密度.7只代表连续部分,积分.7,不能代表全部模型。有真正点质量和连续测量的数据需混合表示,强塞纯PMF或让普通PDF吞原子会丢信息。

绝对连续X的F是密度积分,在合适正则处F′=f;不需要每点都可微。一般分布即使无普通密度CDF仍有效。因此通过F计算区间常比从平滑图推密度可靠。调用数值库PMF或PDF前,先明确分布数学类型。

混合分布CDF零处CDF跳到零点三,零到一线性增长至一;普通密度零点七只代表连续部分。CDF可保留原子与连续部分.3101F(t)=.3+.7t零原子.3;(0,1)密度.7;连续部分只积分.7。
图 22.2

离散CDF在正质量值跳跃,连续密度按面积累积,混合CDF同时保留跳跃和连续增长。

检验理解

PDF能超过1吗?正密度给正单点概率吗?混合模型连续部分自己必须积分1吗?

查看答案

可以,要求总积分1。绝对连续点概率零。.3原子/.7均匀例连续积分.7,原子补其余。

5

分位数 逆抽样与经验分布函数

0<u<1定义广义分位Q(u)=inf{x:F(x)≥u}。极限性质保证内部u的阈值有限,右连续保证F(Q(u))≥u。单调及右连续给关键等价Q(u)≤t当且仅当u≤F(t)。严格增连续CDF有普通逆,离散阶梯需广义定义。分位水平是概率,输出是变量单位。

由等价得逆CDF抽样:理想U均匀(0,1),P(Q(U)≤t)=P(U≤F(t))=F(t)。离散路线可视为按累积概率区间长度选值,不需密度积分即可实现有限加权抽样,正确性是区间质量恒等式。连续分支同论证用均匀区间模型给目标连续分布。

离散有序x₁<…<x_m、累积c_j,取第一个c_j≥u的j返回x_j。区间(c_{j−1},c_j]长度p_j,零质量为空区间可移除。正面计数1/4、1/2、1/4给Q(.2)=0、Q(.5)=1、Q(.9)=2,按下确界约定Q(.25)=0。平局与端点应明确,不依赖软件未说明的插值。

例题详解
几何分位编码等待实验

试验p=1/4的F(k)=1−(3/4)^k,首次≥u的整数k≥1为分位。u=.5时F(2)=7/16<.5、F(3)=37/64>.5,所以Q(.5)=3。0<p<1可数值用ceil(log(1−u)/log(1−p))并至少为1;p=1直接返1。实验2把实际生成器零端点分配给首次试验,数学定义使用内部u。

连续指数逆解u=1−exp(−λx),得x=−log(1−u)/λ。小u用log1p(−u)精确计算log(1−u),排除u=1否则无限。仿射均匀用a+(b−a)u。这些假设输入均匀;有限精度伪随机实际上从有限可表示格抽样,近似理想连续机制。可复现和数值细节与精确分布定理分开。

观察x₁,…,x_N的ECDF F_N(t)=Σ1{x_i≤t}/N,是每观察质量1/N的离散分布,重复值合成较大跳跃。有序值的右插入下标实现≤,左插入只算严格小于。连续数据的有限ECDF仍阶梯,因为仅有限观察;平滑得到另一估计器,不是ECDF定义。

在明确阈值比较经验与理论CDF,不要求有限样本精确匹配。种子轨迹可展示抽样,不建立通用偏差保证,模块24再给集中和极限。软件分位插值可能与广义逆不同,尤其小样本和平局。中位、百分位或尾阈值用于算法和基准时,需报告约定,分布定义与数值摘要包含关系应一致。

交互演示

探索器比较二项PMF与阶梯CDF,连续分支再比较均匀PDF与CDF。分别报告P(X=t)、P(X≤t)及质量或密度,切换时高度含义改变。Uniform(0,.5)的PDF为2,仍总质量1且单点零。

检验理解

离散CDF为何用广义逆?ECDF在平局阈值数什么?有限精度逆抽样精确再现连续统吗?

查看答案

阶梯有跳跃和平段,不存在普通逆。ECDF用≤包含全部平局。有限生成器在有限格近似连续统,需标记数值机制。

6

变换应加原像或使用绝对Jacobian

Y=g(X)从事件恒等式P(Y∈S)=P(X∈g⁻¹(S))开始。离散p_Y(y)=Σ_{x:g(x)=y}p_X(x)。单射仅重标质量,多对一加所有原像。输出支持是原正质量支持的像,不是公式能求值的所有数。变换可减少可能值,也仍依赖原变量。

pY(y)=∑x:g(x)=ypX(x).p_Y(y)=\sum_{x:g(x)=y}p_X(x).
例题详解
离散平方需合并两种符号

X取−2,−1,1,2,各1/4。Y=X²将±1都映到1、±2都映到4,故两输出各1/2。仅保留正原像总质量1/2错误。CDF在1下0,[1,4)为1/2,4及以上1。该离散变换是CS对连续Jacobian计算的替代。

连续AI分支: g在相关区间可微严格单调、逆可微,则变换支持上f_Y(y)=f_X(g⁻¹(y)) |(g⁻¹)′(y)|。递增时F_Y=F_X∘g⁻¹,链式求导给逆导。递减时事件变为X≥g⁻¹(y),无点质量时补CDF给负导,绝对值统一两种并保证非负。

fY(y)=fX ⁣(g−1(y))∣ddyg−1(y)∣.f_Y(y)=f_X\!\left(g^{-1}(y)\right)\left|\frac{d}{dy}g^{-1}(y)\right|.

Y=cX+d、c≠0给f_Y(y)=f_X((y−d)/c)/|c|,倒数因子补偿区间伸缩。X均匀(0,1)、Y=2X因此在(0,2)密度1/2,漏因子会总质量2。c=0则Y在d原子,公式不适用,除零不能表示退化分布。Jacobian描述坐标体积,不是改变总概率。

非一对一g需分单调分支,加各逆贡献,处理支持和临界例外。X均匀(−1,1)、Y=X²给F_Y(y)=P(−√y≤X≤√y)=√y,0≤y≤1。内部导得1/(2√y),正负逆各贡献1/(4√y),漏一支损半质量。零附近奇异密度可积:∫_0^1 1/(2√y)dy=1,P(Y=0)=0。

先CDF常比死记单逆可靠。支持外概率密度零;特殊点可能需单独原子处理。若g把正概率区间压到一个值,则产生原子,绝对连续输入不总给绝对连续输出。例X均匀(−1,1),max(X,0)有零原子1/2及(0,1)密度1/2。

核查单位与归一。X秒、Y=1000X毫秒,数值密度缩小1000,因为单位变为每毫秒;一致换算后区间概率相同。因此连续似然密度依观察单位,一致变换两模型的似然比共享并消掉坐标因子,但跨不一致单位比较原高度无意义。后续估计再区分密度似然与点事件概率。

密度变换需因子及两分支均匀零一倍增后宽二密度二分之一;均匀负一一平方需正负平方根两个逆支,总密度一除二平方根。坐标伸缩与多个逆分支X∼Uniform(0,1)Y=2XfY=1/2 on(0,2)宽度×2,高度÷2X∼Uniform(−1,1)Y=X²x=+√y and −√yfY=1/(2√y), 0<y<1两逆支各1/(4√y);总质量1,零无原子。
图 22.3

仿射拉伸需倒数密度因子,平方需两逆分支;零附近高可积密度不是原子。

检验理解

离散多对一如何合并?连续逆导为何取绝对?连续输入必给连续分布输出吗?

查看答案

加全部映到输出的质量。递减逆导负而密度须非负。压缩正概率区间产生原子,输出可混合。

7

选择模型 支持约定与实现契约

依合理生成故事选族并检查支持。Bernoulli为一个二元事件,Categorical为一个标签,Binomial为固定独立尝试成功数,Geometric为稳定重复首次成功,Poisson为指定率机制计数。连续等待可在无记忆假设下用指数,Gaussian或Laplace误差需合适位置、尺度和尾故事。曲线匹配或只知“随机”不供应这些假设。

支持错误常比拟合错误易发现。首次成功试验数不可能0,失败数可以。精确Poisson非负整数,Gaussian允许负和非整数;适当情形Gaussian可近似计数,但误差及边界需另证。均匀区间端点要递增,指数率和Gaussian标准差要正。

例题详解
归一因子可以依赖未知参数

Uniform(0,θ)、θ>0对观察x密度(1/θ)1{0<x<θ},略去不影响的端点版本。支持和高度都依θ。θ改变时漏1/θ不保留分布或似然;给x>θ正密度违反模型。相对x常量可能在参数变化时重要,这为后课铺垫。

实现需写单位与参数名:率/尺度、方差/标准差、试验/失败。类别权需非负、总权正才归一,拒空表及非法参数。有限分布能精确则精确求和,无限前缀报告尾。小数值归一误差不同于大漏支、负质量或错支持,先说明数学对象再修数值。

以数值CDF差求极短区间或极远尾可能因相消损精度。专门生存函数可比从舍入的近1CDF减去更精确。它改变公式求值方式,不改事件恒等式。记录阈值、包含约定与数值法,避免把报告的零尾误当数学不可能。

实验标准库有限质量用精确分数,抽样用局部种子,输出明确标CS与连续AI。CS只检查离散段,用原像/CDF替代连续练习;AI用模块17推及核积分。模拟只在几个阈值比较经验CDF,不承诺未经证明的全阈值精度。Gaussian及指数样本是数值抽取,非精确连续统。

分布机制与支持表表区分二项固定尝试,几何首次成功,Poisson率计数,指数连续等待及Gaussian全实支持,提醒参数约定。从机制与支持选择分布二项固定n、独立同p0,…,n几何试验稳定尝试首次成功1,2,…Poisson固定区间率机制0,1,…指数(AI)连续恒率等待[0,∞)Gaussian(AI)位置与正尺度误差R几何失败数从0;率≠尺度,方差≠标准差。
图 22.4

模型依机制、支持与参数约定选择;熟悉族名不能替代独立或恒率假设。

学习目标中离散观察似然用PMF,绝对连续观察用指定坐标参考下PDF。具体x的连续密度不等于P(X=x),记录乘积也需抽样分解假设。模块25由这些区别推估计与损失;现在的完整成果是推导分布、正确包含端点的概率及通过总质量和支持核查的变换。

检验理解

计数自动Poisson吗?指数及非退化Gaussian哪些参数须正?θ变化时可忽略相对x常量吗?

查看答案

不能,仍需生成假设。指数率与Gaussian标准差须正。均匀1/θ相对x常量却随θ变,参数似然中不可丢。

8

常见误解

说法 修正
随机变量就是已观察的数。 它是映射,数为实现。
可能数值自动均匀。 合并原像质量。
PDF值是单点概率。 密度需积分,连续点零质量。
每个分布都有普通PDF。 离散及混合保留原子。
CDF不含端点。 F(t)=P(X≤t)。
几何总从零开始。 区分失败数与试验数。
平方只需一个逆支。 两符号均可贡献。
熟悉形状证明机制。 明确支持、独立、率及参数约定。
9

三个可复现实验

实验1 · 离散PMF CDF及无限尾

下载 lab1_discrete_distributions.py

"""Exact binomial/geometric tables; numerical Poisson partial sums."""
from fractions import Fraction as F
from math import comb, exp, factorial

if __name__ == "__main__":
    n, p = 5, F(2, 5)
    masses = [F(comb(n, k))*p**k*(1-p)**(n-k) for k in range(n+1)]
    cumulative = F(0)
    for k, mass in enumerate(masses):
        cumulative += mass
        print("binomial k=%d pmf=%s cdf=%s" % (k, mass, cumulative))
    assert cumulative == 1
    print("binomial P(X>=3)=%s = %.8f" % (sum(masses[3:]), float(sum(masses[3:]))))
    p = F(1, 4)
    K = 10
    partial = sum((p*(1-p)**(k-1) for k in range(1, K+1)), F(0))
    tail = (1-p)**K
    print("geometric trials support starts at1: sum1..10=%s remaining=%s" % (partial, tail))
    assert partial+tail == 1
    print("geometric P(X>3)=%s" % ((1-p)**3))
    rate = 2.0
    for K in (5, 10, 20):
        partial = sum(exp(-rate)*rate**k/factorial(k) for k in range(K+1))
        print("Poisson lambda=2 sum0..%d=%.12f remainder=%.3e" % (K, partial, 1-partial))
    print("PASS: finite normalisation exact; an infinite table needs an explicit tail")
输出
binomial k=0 pmf=243/3125 cdf=243/3125
binomial k=1 pmf=162/625 cdf=1053/3125
binomial k=2 pmf=216/625 cdf=2133/3125
binomial k=3 pmf=144/625 cdf=2853/3125
binomial k=4 pmf=48/625 cdf=3093/3125
binomial k=5 pmf=32/3125 cdf=1
binomial P(X>=3)=992/3125 = 0.31744000
geometric trials support starts at1: sum1..10=989527/1048576 remaining=59049/1048576
geometric P(X>3)=27/64
Poisson lambda=2 sum0..5=0.983436391519 remainder=1.656e-02
Poisson lambda=2 sum0..10=0.999991691776 remainder=8.308e-06
Poisson lambda=2 sum0..20=1.000000000000 remainder=5.995e-15
PASS: finite normalisation exact; an infinite table needs an explicit tail

预测精确二项尾、几何余质量及Poisson前缀。说明有限二项归一与无限Poisson前缀为何用不同检查。

实验2 · 样本与经验CDF

下载 lab2_sampling_and_ecdfs.py

"""Seeded discrete/continuous samples with exact CDF references; standard library."""
from bisect import bisect_right
from math import log1p, exp
import random


def geometric_trials(u, p):
    if not 0 < p <= 1 or not 0 <= u < 1:
        raise ValueError("require 0<p<=1 and0<=u<1")
    if p == 1:
        return 1
    # First k with 1-(1-p)^k >= u.
    import math
    return max(1, math.ceil(log1p(-u)/log1p(-p)))


if __name__ == "__main__":
    generator = random.Random(22022)
    N = 20000
    # The finite generator can return0: assign that endpoint to the first trial.
    geometric = sorted(geometric_trials(generator.random(), .25) for _ in range(N))
    print("CS branch: geometric trials, p=.25, N=20000")
    for t in (1, 3, 5, 10):
        empirical = bisect_right(geometric, t)/N
        exact = 1-.75**t
        print("t=%2d empirical CDF=%.6f exact=%.6f" % (t, empirical, exact))
    # AI branch uses Module17 integration to derive these analytic CDFs.
    exponential = sorted(-log1p(-generator.random())/2 for _ in range(N))
    normal = sorted(generator.gauss(0, 1) for _ in range(N))
    print("AI continuous branch: exponential rate2 and standard Gaussian")
    for t in (.25, .5, 1.):
        print("exponential t=%.2f empirical CDF=%.6f exact=%.6f" % (
            t, bisect_right(exponential, t)/N, 1-exp(-2*t)))
    from math import erf, sqrt
    for t in (-1., 0., 1.):
        print("Gaussian t=%+.1f empirical CDF=%.6f exact=%.6f" % (
            t, bisect_right(normal, t)/N, .5*(1+erf(t/sqrt(2)))))
    print("ECDF uses <= via bisect_right; a single trace is not an error theorem.")
输出
CS branch: geometric trials, p=.25, N=20000
t= 1 empirical CDF=0.251550 exact=0.250000
t= 3 empirical CDF=0.583400 exact=0.578125
t= 5 empirical CDF=0.770100 exact=0.762695
t=10 empirical CDF=0.945750 exact=0.943686
AI continuous branch: exponential rate2 and standard Gaussian
exponential t=0.25 empirical CDF=0.393850 exact=0.393469
exponential t=0.50 empirical CDF=0.630350 exact=0.632121
exponential t=1.00 empirical CDF=0.863400 exact=0.864665
Gaussian t=-1.0 empirical CDF=0.161500 exact=0.158655
Gaussian t=+0.0 empirical CDF=0.499350 exact=0.500000
Gaussian t=+1.0 empirical CDF=0.841250 exact=0.841345
ECDF uses <= via bisect_right; a single trace is not an error theorem.

CS检查几何段及分位,AI还用模块17推指数与Gaussian参考CDF。解释≤、局部种子及有限轨迹边界。CS以推离散逆抽样代替连续公式时间。

实验3 · 变换与支持错误

下载 lab3_transformation_and_support_faults.py

"""Many-to-one discrete transforms, Jacobian correction, and support diagnostics."""
from fractions import Fraction as F
from math import sqrt, exp

if __name__ == "__main__":
    masses = {-2: F(1, 4), -1: F(1, 4), 1: F(1, 4), 2: F(1, 4)}
    transformed = {}
    for x, mass in masses.items():
        transformed[x*x] = transformed.get(x*x, F(0)) + mass
    print("CS branch X masses:", {x: str(p) for x, p in masses.items()})
    print("Y=X^2 masses (sum every preimage):", {y: str(p) for y, p in transformed.items()})
    assert sum(transformed.values()) == 1
    print("support diagnosis: waiting trials cannot be0; geometric failures can be0")
    print("Poisson counts include0; Gaussian counts can be negative/noninteger, so are not a count model")
    print("AI continuous branch requires Module17: X uniform(0,1), Y=2X")
    print("wrong density1 on(0,2): total mass=2; corrected density1/2: total mass=1")
    print("nonmonotone example X uniform(-1,1), Y=X^2")
    for y in (.04, .25, .81):
        cdf = sqrt(y)
        density = 1/(2*sqrt(y))
        print("y=%.2f CDF=%.6f density=%.6f" % (y, cdf, density))
    eps = 1e-4
    corrected_mass = 1-sqrt(eps)  # integral eps..1 of 1/(2sqrt(y))
    omitted_branch_mass = corrected_mass/2
    print("mass eps..1: both branches=%.6f one branch only=%.6f omitted0..eps=%.6f" % (
        corrected_mass, omitted_branch_mass, sqrt(eps)))
    assert abs(corrected_mass+sqrt(eps)-1) < 1e-12
    print("exponential rate2: density at0=2, P(X=0)=0, P(0<X<=.1)=%.8f" % (1-exp(-.2)))
    print("PASS: discrete preimages add; continuous inverse branches need absolute Jacobians")
输出
CS branch X masses: {-2: '1/4', -1: '1/4', 1: '1/4', 2: '1/4'}
Y=X^2 masses (sum every preimage): {4: '1/2', 1: '1/2'}
support diagnosis: waiting trials cannot be0; geometric failures can be0
Poisson counts include0; Gaussian counts can be negative/noninteger, so are not a count model
AI continuous branch requires Module17: X uniform(0,1), Y=2X
wrong density1 on(0,2): total mass=2; corrected density1/2: total mass=1
nonmonotone example X uniform(-1,1), Y=X^2
y=0.04 CDF=0.200000 density=2.500000
y=0.25 CDF=0.500000 density=1.000000
y=0.81 CDF=0.900000 density=0.555556
mass eps..1: both branches=0.990000 one branch only=0.495000 omitted0..eps=0.010000
exponential rate2: density at0=2, P(X=0)=0, P(0<X<=.1)=0.18126925
PASS: discrete preimages add; continuous inverse branches need absolute Jacobians

离散段合平方原像、检查等待及计数支持;需模块17的连续段修仿射因子与遗漏逆支,再区分密度2和概率。所有输出从显示的可下载代码实际捕获。

10

十四道练习及完整解答

练习1–12必做,路线替代占相同时间;选做13–14在十小时核心外增35分钟。

练习 1★★★计算6 分钟

公平两币正面数,给p(1)、F(1)、F(1−)及P(0<X≤1)。

查看解答

分别1/2、3/4、1/4及F(1)−F(0)=1/2。端点原子解释左右极限不同。

练习 2★★★计算6 分钟

二项n=5、p=.4,给P(X≥3)及CDF补式。

查看解答

992/3125=.31744,等于1−F(2)。1−F(3)漏3质量,公式假设独立同率尝试。

练习 3★★★计算6 分钟

几何试验p=1/4,给P(T=1)、P(T>3)、P(T≤3);失败数G怎样?

查看解答

1/4、27/64、37/64。G=T−1从0,P(G=0)=1/4,阈值移一;约定需伴随概率。

练习 4★★★计算6 分钟

CS:等可能−2,−1,1,2平方。AI替代:X均匀(0,.5),给.25密度与点概率。

查看解答

CS输出1,4各1/2,两符号贡献;AI内部密度2,P(X=.25)=0。两者都分开表示与输出概率。

练习 5★★★proof14 分钟

证明CDF跳跃等于点质量,再推P(a<X≤b)。

查看解答

递增事件趋{X<t}给F(t−)。{X≤t}分成不交{X<t}与{X=t}给跳跃;{X≤b}分成{X≤a}与{a<X≤b}给差式,混合也成立。

练习 6★★★proof14 分钟

由试验模式推二项质量及归一。

查看解答

独立共同p给k成功模式质量p^k(1−p)^{n−k},有comb(n,k)不交模式。总计覆盖所有试验,质量1,亦即二项式定理。退化端点直接处理。

练习 7★★★proof14 分钟

CS:证明离散变换原像公式及归一。AI替代:推递增可逆变换密度因子。

查看解答

CS不交{X=x}映至y,相加得P(Y=y),每输入计一次保留和1。AI F_Y=F_X∘g⁻¹,链式给f_X(g⁻¹)(g⁻¹)′;递减符号相反,统一绝对逆导。

练习 8★★★application10 分钟

正面计数分布求Q(.2)、Q(.25)、Q(.5)、Q(.9),给抽样区间。

查看解答

0、0、1、2。输入(0,.25]返0,(.25,.75]返1,(.75,1)返2,长度匹配PMF,数学分位用0<u<1。

练习 9★★★application10 分钟

CS:观察1,1,3,4的ECDF在1和2。AI替代:X均匀(0,1),推Y=2X支持、密度、CDF。

查看解答

CS两值均2/4=.5,包含1的平局。AI支持(0,2),内部密度1/2,CDF在y≤0为0、内部y/2、y≥2为1。积分1,错密度1则积分2。

练习 10★★★application10 分钟

十次独立固定p尝试的成功数与同机制首次成功试验数各选何模型?写支持。

查看解答

固定数Binomial(10,p)支持0,…,10;首次Geometric(p)支持1,2,…、0<p≤1。变成功率或相依破坏假设,计数标签不能自己选模型。

练习 11★★★diagnosis10 分钟

实现归一Poisson前缀,并接受首次成功试验数零。修正。

查看解答

前缀漏尾,归一给条件截断而非原Poisson。试验从1,失败可从0。写目标、余质量及等待约定。

练习 12★★★diagnosis10 分钟

CS:平方仅保正原像。AI替代:均匀(−1,1)平方只保正逆支。诊断归一。

查看解答

CS仅+1,+2总质量1/2,加负原像得1,4各1/2。AI每支1/(4√y),两支1/(2√y)积分1,漏支积分1/2。零无原子。

练习 13★★★extension15 分钟

CS推几何尾无记忆。AI替代推指数无记忆,说明条件分母要求。

查看解答

CS正分母时(1−p)^{m+n}/(1−p)^m=(1−p)^n。AI s,t≥0、λ>0时exp(−λ(s+t))/exp(−λs)=exp(−λt)。这是具体模型恒等式,非普遍等待性质。

练习 14★★★extension20 分钟

CS:X质量−1:1/4、0:1/4、1:1/2,推max(X,0)。AI替代:X均匀(−1,1)推同变换混合律。

查看解答

CS零合两质量1/2,一质量1/2。AI负半区间成零原子1/2,正区间保密度1/2。CDF负为0,零1/2,内部(1+y)/2,上方1。连续积分仅1/2,须留原子。

11

十题自测

1
实验实现前随机变量是什么?
2
CDF包含哪个端点?
3
二项生成故事是什么?
4
首次成功几何试验数支持从哪里?
5
离散多对一怎样算?
6
什么也描述混合分布?
7
二项P(X≥3)用哪个补?
8
ECDF在平局阈值数什么?
9
命名分布仍需要什么?
查看答案

CS输出1,4各1/2,CDF在1下0、[1,4)为1/2、4及以上1;均匀输入(0,.5]映1、(.5,1)映4。AI F_Y在[0,1]为√y,外为0或1;每支1/(4√y),总1/(2√y),内部积分1。密度奇异但P(Y=0)=0,保端点与支持。

12

有目的的阅读

使用MIT 6.041SC随机变量与分布材料,以及作者Mathematics for Machine Learning配套页概率选读。连续需模块17,CS选离散PMF、CDF和变换。

时间 选读及问题
第1次 · 15分钟 随机变量与离散族:什么原像及假设创造质量?
第4次 · 15分钟 CDF与变换:支持、端点及坐标因子应保留什么?
13

检索 结业任务与下一步

区分结果、映射、实现;推PMF,用CDF端点算事件,写分位抽样及多对一变换。AI额外检查密度积分与绝对逆因子。

结业任务: 推二项尾992/3125、几何.5分位3,以及含两符号的平方分布,说明每个高度代表何数学对象。

可以继续: 你能按明确假设选择及变换分布。期望和联合模型接下来连接平均成本、变异及依赖。见课程总览。

14

记号与双语术语

记号或术语 含义 English
X、x、原像 结果映射、实现、产生输出事件的输入 Variable, realisation, preimage
PMF、PDF、CDF 点质量、连续密度、累积概率 Mass, density, cumulative distribution
支持、原子 支持值、正单点质量 Support, atom
率、尺度、σ² 倒数时间、率的倒数、方差参数 Rate, scale, variance parameter
Q、ECDF 广义分位、经验累积分布 Quantile, empirical CDF
Jacobian、分支 坐标体积因子、逆的各段 Jacobian, branch
混合分布 点质量及连续部分 Mixed distribution