主页
PAPER · 论文

SLDDM-TPG: Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation

(第一作者 Accepted by AAAI 2026 [CCF-A])
2025-11-06 论文

给定一个自然衣服图像,SLDDM-TPG 可以精准解耦复杂图案与衣物非刚性形变,生成一张平整、清晰、无缺陷的高保真工业级纺织品设计图,可直接用于时装设计图生产 (详情可点击上面的Arxiv标志查看论文,点击上面的Github标志访问项目代码)。

SLDDM-TPG: Semi-supervised Latent Disentangled Diffusion Model for Textile Pattern Generation
PAPER · 论文

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

(第一作者 Accepted by ACMMM 2026 [CCF-A])
2026-01-29 论文

给定一段音频和一张参考人脸图像,**GemTalk** 就能生成唇形对齐、且携带精准音频情绪的说话人视频。它首创了几何先验引导的隐式特征调制模块,在不损失视觉高频细节的前提下,实现了精准、连续的情感强度控制,且不对视频质量和唇音同步造成损失。

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation
PAPER · 论文

HuggingR4: A Progressive Reasoning Framework for Discovering Optimal Model Companions

(共同一作 Accepted by EMNLP 2026 [NLP 顶会])
2026-01-29 论文

HuggingR4 是一个全新的模型自动化发掘框架,它能根据用户模糊的自然语言需求,从 HuggingFace 网站数以百万计的仓库中通过多步逻辑推理检索筛选出最适合解决对应任务的模型工具,极大地延伸了 LLM Agent 的能力边界(详情可点击上面的 Arxiv 标志查看论文)。

HuggingR4: A Progressive Reasoning Framework for Discovering Optimal Model Companions
PAPER · 论文

Diffusion Model Quantization: A Review

(共同一作 Under Review by IJCV2025 [CCF-A类期刊,CV领域顶刊])
2025-05-25 论文

一篇关于扩散模型量化(Diffusion Model Quantization)方向的全面综述,系统化梳理了从 U-Net 到 DiT 架构的底层量化困境,并从视觉伪影与去噪轨迹偏移双重视角开创性地剖析了量化误差,构建了该领域首个统一基准与开源平台(详情可点击上面的Arxiv标志查看论文,点击上面的Github标志访问项目主页)。

Diffusion Model Quantization: A Review
PAPER · 论文

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective

(Under Review by AAAI 2027 [CCF-A])
2026-08-13 论文

给定一张源图像与一句编辑指令,EditMod 直接从编码后的源图像状态出发,把编辑建模为"源到目标"的残差变化,无需反演、无需测试时优化、也无需用户提供 mask,即可实现免训练(training-free)的高保真文本引导图像编辑(详情可点击上面的 Arxiv 标志查看论文)。

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective
INTERNSHIP · 实习

快手基础大模型与应用部实习|电商挂店短视频智能剪辑与生成算法

2026-05-06 实习

在快手社区科学线-基础大模型与应用部实习期间,我负责了电商带货场景下挂店短视频的智能剪辑与生成算法。核心工作分为两大部分:一是从零搭建「鸡汤类挂店短视频」智能剪辑 pipeline 并推动上线;二是通过视频编辑大模型实现素材质量的提升与扩充。两段工作都直接服务于真实的电商内容生产链路。

快手基础大模型与应用部实习|电商挂店短视频智能剪辑与生成算法
INTERNSHIP · 实习

Tencent GY-Lab(QQ影像中心)实习|流式实时可交互长视频生成:双向教师 → 因果流式 → 实时数字人

2026-06-05 实习

在腾讯 PCG–QQ 影像中心(Tencent QQ GYLab)实习期间,我把线上「一次只能生成 10 秒、人相关剧情片段」的双向模型,升级成了一套**因果流式、实时可交互**的长视频系统:先用 I/R2AV + Teacher/Diffusion Forcing 训出 30 步因果学生,再用 Self-Forcing + DMD 蒸馏到 8 步,靠 blank chunk + KV-Cache 双阶段纠偏稳住 8–10 分钟长视频,最后在单卡 H20 上做到 5 秒视频 4 秒出片(约 20 倍加速)、28 fps 的可交互数字人。

Tencent GY-Lab(QQ影像中心)实习|流式实时可交互长视频生成:双向教师 → 因果流式 → 实时数字人
RECORD · 记录

6 个主流音视频生成模型推理性能

2026-08-28 记录

这是一份关于当前主流音视频生成模型的推理性能实测记录。统一在 H20 (96GB) 单卡(MAGI-2 除外)上,以 640×640、5 秒视频为基准,对 MOVA、LTX-2.3、Bernini-S2V、MiniMax-H3、MAGI-2 Preview、LTX-2.5 六个模型进行推理耗时、显存与效果对比,并额外加入 MiniMax-H3 Turbo 作为 H3 的加速变体一并测试。

6 个主流音视频生成模型推理性能
1