LOADING
Video Audio Multimodal —— 视频理解 & 视频生成 & 音频处理
系统讲解视频理解与生成、音频处理的核心技术:从视频的时空维度出发,剖析3D卷积与时空注意力如何建模动态信息;深入解读VideoMAE的视频Tube掩码策略与90-95%超高掩码比例的时空自监督预训练;剖析Sora视频扩散模型的核心组件及其灵活处理任意分辨率/时长视频的能力;梳理音频处理基础与Whisper的编码器-解码器架构,并介绍VALL-E将语音合成建模为条件语言模型的新范式。
4030 words
|
20 minutes
Cover Image of the Post
Vision-Language-Action —— VLA具身智能
系统讲解具身智能中视觉-语言-动作模型(VLA)的核心技术:从RT-2的“动作即文本”范式出发,剖析动作Token化与Co-Fine-Tuning联合微调策略的数学原理;深入解读动作分块如何通过一次性预测未来K步动作解决时序不一致性问题;推导扩散策略中条件去噪扩散过程的噪声预测损失及其与动作分块的天作之合;并通过三维对比揭示各自优势与融合趋势。
5734 words
|
29 minutes
Cover Image of the Post
Multimodal RAG —— 多模态RAG
系统讲解多模态文档检索的前沿技术ColPali:从传统OCR流水线的脆弱性出发,剖析ColPali如何通过PaliGemma视觉语言模型直接编码文档页面图像,跳过OCR与布局解析环节;深入解读延迟交互机制中MaxSim评分函数的数学原理及其相比单向量余弦相似度的精度优势;分析多粒度索引策略与跨模态查询重写技术。
4750 words
|
24 minutes
Cover Image of the Post
Denoising Diffusion Probabilistic Models —— DDPM扩散模型
系统讲解扩散模型(DDPM)的数学原理与条件生成技术:从马尔可夫链的前向扩散与反向去噪出发,推导ELBO如何简化为噪声预测MSE损失;深入剖析潜空间扩散如何通过VAE压缩实现约50倍计算量降低;追溯去噪网络从U-Net到DiT的架构演进及其在Sora中的应用;解析CFG的线性外推公式及引导强度的权衡.
4160 words
|
21 minutes
Cover Image of the Post
Multimodal Large Language Model —— MLLM多模态大语言模型
系统讲解多模态大语言模型(MLLM)的核心架构设计与训练范式演进:从模态连接器的三种经典方案出发,剖析视觉编码器的解冻策略与三阶段训练范式;深入探讨细粒度数据标注、幻觉缓解与评估基准;最后追溯从“拼接式”架构到原生统一架构的演进路径,揭示从“表征对齐”到“表征统一”的范式转变。
3880 words
|
19 minutes
Cover Image of the Post
Vision-Language Model —— VLM视觉语言模型
系统讲解视觉语言模型(VLM)的通用架构,深入对比三种主流连接器方案的设计权衡;详细剖析两阶段训练流程及其目标差异;梳理从双塔架构到原生多模态的三代演进路径;最后深度解析Qwen3-VL的三项核心创新——Interleaved-MRoPE、DeepStack集成、文本化时间戳对齐,及其2B/4B/8B/32B稠密和MoE架构的模型系列与256K超长上下文特性。
3637 words
|
18 minutes
Cover Image of the Post
Vision Transformer —— ViT视觉Transformer
系统讲解视觉Transformer(ViT)的核心机制与技术演进:从Patch Embedding与位置嵌入的基础原理出发,对比ViT与CNN在归纳偏置上的根本差异及DeiT通过知识蒸馏弥补数据效率的尝试;深入剖析Swin Transformer的窗口注意力与层级化特征表示、可变形注意力的动态聚焦机制;系统梳理高分辨率适配的三条技术路线——AnyRes/LLaVA-UHD的切图融合策略、NaViT/ViTAR的原生动态分辨率方案、以及RoPE/插值/LookHere等位置编码外推方法。
4051 words
|
20 minutes
Cover Image of the Post
Contrastive Language-Image Pre-training —— CLIP对比学习
系统讲解CLIP的核心原理与技术演进:从双塔架构出发,推导InfoNCE损失函数的数学本质及其与交叉熵的等价性;剖析WIT-400M大规模图文对预训练的工程挑战;深入解读零样本分类的工作原理;并介绍SigLIP如何通过Sigmoid损失替代Softmax归一化,实现更优的小批次训练效率与灵活性。
3505 words
|
18 minutes
Cover Image of the Post
RLVR (Reinforcement Learning with Verifiable Rewards) —— 可验证奖励强化学习
系统梳理RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想、数学形式化、主流算法(PPO、GRPO、PACS、ROVER)及训练流程,对比RLHF与RLVR的本质差异,并探讨验证器可靠性、奖励稀疏等核心挑战与前沿解决方案。
4514 words
|
23 minutes
Cover Image of the Post
大模型强化学习对齐方案:PPO、GRPO、DPO、DAPO与GSPO技术详解与对比
从12个核心维度系统对比PPO、GRPO、DPO、DAPO与GSPO五种大模型强化学习对齐算法,剖析其技术演进脉络、核心机制与适用场景,揭示从"通用重器"到"专属利刃"的进化逻辑。
4084 words
|
20 minutes
Cover Image of the Post
Profile Image of the Author
Zhang Haoyi
Hello, I'm Zhang Haoyi, a passionate developer and blogger. Welcome to my personal space where I share my thoughts, projects, and experiences.
Directory
Albums
Diary
Posts
Projects
Skills
Timeline
Categories
Tags
Table of Contents
Statistics