
网问答>>[alphaXiv速递] Kaiming新作,高度压缩的Tokenizer可直接用于图像生成
问题
[alphaXiv速递] Kaiming新作,高度压缩的Tokenizer可直接用于图像生成
时间:2026-01-21 15:12:51
[alphaXiv速递] Kaiming新作,高度压缩的Tokenizer可直接用于图像生成
最佳回答
Kaiming新作提出了一种高度压缩的1D Tokenizer(TiTok),无需训练独立的生成模型,仅通过测试时优化即可直接用于图像生成任务。 该研究挑战了传统图像生成中“压缩标记器+生成模型”的范式,证明极致压缩的标记器(如仅32个离散标记)可通过解码器内在的生成能力完成多样化任务。以下是关键内容梳理:一、核心方法:1D标记器与测试时优化TiTok架构极致压缩:使用Vision Transformer (ViT)编码器将图像压缩为32个离散标记(传统二维标记器通常生成数百至数千个空间排列的标记),并通过向量量化(VQ)生成离散潜在空间。全局信息编码:1D标记器放弃空间排列,每个标记捕获更多全局语义(如场景光照、主体类型),解码器需从最少信息中重建复杂内容,从而发展出强大表示能力。图:TiTok将图像压缩为32个离散标记,解码器从中重建完整图像基于梯度的测试时优化优化流程:初始化标记(可来自种子图像或随机);计算目标函数(如CLIP文本相似度、重建损失)相对于标记特征的梯度;使用Adam优化器更新标记,结合正则化技术(噪声注入、L2正则化)防止过拟合。关键机制:通过直通估计器(straight-through estimator)将梯度反向传播通过离散标记,实现端到端优化。二、主要发现:压缩与生成质量的反直觉关系压缩提升生成质量TiTok-LL-32模型(32个标记,码本大小4096)在生成质量上显著优于更多标记或更大码本的变体。极致压缩迫使标记器学习更泛化的表示,解码器需更复杂以重建图像,反而提升了生成效果。图:更高压缩(更少标记、更小码本)导致更好生成质量离散潜在空间至关重要向量量化(VQ)提供的离散瓶颈对生成性能起关键正则化作用,连续VAE变体表现明显更差。1D标记器的独特性传统2D标记器(如VQGAN)在该方法中失效,表明高度压缩的全局信息编码是1D标记器成功的核心。三、应用场景:灵活的图像生成与编辑文本引导图像编辑优化标记以最大化CLIP与文本提示的相似性,实现主体转换(如蓝鸦背景替换)同时保留姿势和结构。图:蓝鸦在不同背景下的转换,保留原始姿势复制粘贴编辑直接复制参考图像的标记到目标图像,转移照明或图像质量等属性(如将高质量图像的标记粘贴到低质量图像上)。图:跨图像转移照明和质量属性图像修复与无条件生成修复:优化标记以最小化未遮蔽区域的重建损失,结合周期性“标记重置”保持连贯性。无条件生成:从随机标记初始化,针对文本提示或其他目标优化,生成多样化图像。图:成功修复遮蔽区域并保持视觉连贯性四、局限性与未来方向当前局限极致压缩可能限制细粒度细节控制;需仔细调整优化超参数;绝对生成质量未超越专用生成模型(如Stable Diffusion)。未来工作探索更高压缩比(如更少标记);研究替代优化策略(如扩散模型结合);扩展至自然图像以外的领域(如医学影像、3D数据)。五、意义:范式转变与高效生成系统理论贡献:挑战“表示学习与生成分离”的传统观念,证明极致压缩的标记器可兼具表示与生成能力。实际价值:降低计算部署成本,通过语义解耦提高可解释性,支持即插即用的目标函数(如灵活切换文本引导或属性编辑)。研究启示:强制模型学习最大程度压缩的表示,可能是开发更强大视觉AI系统的关键。参考文献核心论文:Yu, Q., et al. (2024). An image is worth 32 tokens for reconstruction and generation. NeurIPS.关键技术基础:CLIP(Radford et al., 2021)、VQ-VAE(van den Oord et al., 2017)、VQGAN-CLIP(Crowson et al., 2022)。
时间:2026-01-21 15:12:58
本类最有帮助
- 关于贵巢床垫,听说其环保性能怎么样呢?
- 喜元帅瓷砖属于几线品牌?
- 长安的荔枝被禁播了么
- 这是边牧串吗?
- 云彩石地坪漆有什么优势?家里能用吗?
- 针对一般家庭装修,云彩石品牌提供怎样的组合方案?
- 听说藏天参和普通人参存在区别,为什么它的价格会更
- 叶良柱为什么选择给家具涂木蜡油而不是化学漆呢?
- 王浩输给过谁
- 小人全部滚。。。别想合好。。一个字穷?
- 包头包钢友谊宾馆酒店介绍
- 为啥应该感谢别人帮忙,但是有些人是要求别人感谢他
- 感恩是怎么来的,为啥有的人劝人目的是别人必须感谢
- 关于央心心理咨询,目前它的收费贵不贵呢?
- 关于央心心理咨询,第一次体验目前感觉如何?
- 对于央心心理咨询APP,收费标准是怎样的?
- 关于央心心理咨询,听说有线下机构分布吗?
- 二把手做好二把手
- 他对我有意思吗?
- 我喜欢你和能做我女朋友吗哪个正式有仪式感?
- 教师节写给教师的贺卡祝福贺词
- 以前很珍贵的应用,不小心删了,然后又忘了他的名字
- 以前很珍贵的赚钱应用,不小心删了,然后又忘了他的
- 最近麻烦事多,工作干不下去做不开心,新工作又不可
- 为什么我总是被用别人的咒骂语才能把自己隐藏到人群
- 一个未婚大龄女性,被一个已婚有子女的女人骂绝子绝
- 汽修兄弟们,有没有轻巧还贼拉带劲的电动扳手?
- 新国标电动车能解限速吗
- 光伏发电组成部分?
- 光伏板最多串联多少组?
- 光伏板之间怎么连接?
- 炫潮隐形车衣怎么样?
- 炫潮隐形车衣值得购买吗?
- 隐形车衣炫潮怎么样?
- 汽车解码器进不到系统是什么原因?
- 自由光喇叭什么牌子
- 炫潮品牌隐形车衣质量怎么样?
- 简单回答一下发动机电脑控制点火系统的工作过程
- 2014年A8发动机电脑版多少钱?
- 鉴别本田割草机真假识别
- 关于店商豹,它是怎么赚钱的?
- 当前银监会能否帮助协商还款
- 重庆丰都中学高考成绩亮眼
- 广东岭南职业技术学院有几个校区?地址分别在哪?
- 马明义平凉一中校长
- 广东岭南职业技术学院从广州天河区如何到达清远校区
- 长沙市通航中等职业学校是中专还是大专?可以学哪些
- 手机第一次充电充多长时间好?
- 怎么刷机?
- 王老师买粉笔用去29元7角,买墨水用去57元9角,她付
网问答为提供知识和解答各类疑难的平台,目标是做到有问必答解决您遇到的各类问题.本站内容均为网友发表,并不代表本站立场!
Copyright © 2008-2013 www.wangwenda.com All rights reserved.冀ICP备12000710号-1
投诉邮箱: