新闻中心

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

2024-03-05
浏览次数:
返回列表

当前,大型模型的惊人创新能力持续影响着创意领域,尤其是像Sora这样的视频生成技术代表。虽然Sora已经引领了新一代潮流,但现在或许值得大家关注一下苹果的最新研究成果。

苹果的研究者最近发布了一个名为「Keyframer」的框架,它可以利用大型语言模型生成动画。这个框架允许用户通过自然语言提示来轻松地为静态2D图像创建动画。这项研究展示了语言模型在设计动画方面的潜力,为动画设计师提供了更加高效且直观的工具。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

论文地址:https://arxiv.org/pdf/2402.06071.pdf

刺鸟创客 刺鸟创客

一款专业高效稳定的AI内容创作平台

刺鸟创客 110 查看详情 刺鸟创客

具体而言,该研究结合了基于语言提示设计工件的新兴设计原则和 LLM 的代码生成能力,构建了一个新的 AI 驱动的动画工具 Keyframer。通过 Keyframer,用户可以通过自然语言提示,从静态 2D 图像创建动画插图。借助 GPT-4,Keyframer 可以生成 CSS 动画代码,使输入的 SVG(Scalable Vector Graphic)动画化。

除此以外,Keyframer 支持用户通过多种编辑器类型直接编辑生成的动画。

用户可以通过反复的提示和请求,利用LLM生成的设计变体来不断完善他们的设计,从而在新的设计方向上进行思考。不过,目前Keyframer还没有对外公开。

之所以做这项研究,苹果表示 LLM 在动画中的应用尚未得到充分探索,并带来了新的挑战,例如用户如何有效地用自然语言描述运动。现阶段虽然文生图工具如 Dall・E 和 Midjourney 等效果出色,但动画设计需要考虑更复杂的因素,例如时间以及协调性,这些因素很难在单个提示中全面概括。

用户只需上传图像,并在提示框中输入类似于“让星星闪烁”的内容,然后点击生成即可查看这项研究的效果。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

用户可以在一个批次中生成多个动画设计,并在单独的窗口中调整颜色代码和动画持续时间等属性。无需任何编码经验,因为 Keyframer 会自动将这些更改转换为 CSS,代码本身也是完全可编辑的。这种基于描述的方法比其他形式的人工智能生成动画简单得多,后者通常需要多个不同的应用程序和一些编码经验。

Keyframer 介绍

Keyframer 是一款由 LLM 驱动的应用程序,旨在从静态图像创建动画。Keyframer 可以充分利用 LLM 的代码生成能力,以及静态矢量图(SVG)的语义结构,从而根据用户提供的自然语言提示生成动画。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

输入:该系统提供了一个输入区域,用户可以在其中粘贴他们想要动画化的 SVG 图像代码(SVG 是一种标准且流行的图像格式,在插图中因其可伸缩性及在多个平台上的兼容性而常用)。在 Keyframer 中,SVG 的渲染显示在代码编辑器旁边,以便用户可以预览图像的视觉设计,如图 2 所示,土星插图的 SVG 代码包含了如天空、光环等标识符。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

GPT 提示:该系统允许用户输入自然语言提示来创建动画。用户可以请求单个设计(让行星旋转)或多个设计变体(创建 3 个星星闪烁的设计),之后单击「生成动画」按钮开始请求。在将用户请求传递给 GPT 之前,该研究会用完整的原始 SVG XML 完善其提示,并指定 LLM 响应的格式。

GPT 输出:一旦提示请求开始,GPT 就会传输响应,该响应由一个或多个 CSS 片段组成,如图 3 所示。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

渲染:渲染部分包括(1)每个动画进行可视化渲染以及由 LLM 生成的 1 句解释(2)一系列用于修改设计的编辑器。

其中代码编辑器使用 CodeMirror 实现;属性编辑器为编辑代码提供了特定于属性的 UI,例如为了编辑颜色,该研究提供了一个颜色选择器。图 5 显示了代码编辑器与属性编辑器图示。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

迭代:为了支持用户在动画创建过程 (DG1) 中进行更深入的探索,该研究还提供了一项功能,允许用户使用提示在生成的动画上迭代构建。每个生成的设计下面都有一个按钮「 + Add New Prompt 」;单击此按钮会在页面底部打开一个新表单,供用户使用新提示扩展其设计。

保存设计的侧边栏以及摘要。该系统允许用户对设计加注星标进行收藏并将其添加到侧边栏,如图 6 右侧所示。此外,该系统还有一个摘要模式,其能隐藏所有文本编辑器并显示动画及其提示,使用户能够快速重新访问以前的提示和设计。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

实验过程中,苹果团队选择了 13 名参与者(6 名女性,7 名男性)试用 Keyframer。表 1 为参与者的一些信息及其掌握的技能。

甚至专业动作设计师「EP13」也看到了 Keyframer 扩展其能力的潜力:「我有些担心这些工具会取代我们的工作,因为它的潜力如此之大。但细细想来,这项研究只会提高我们的技能。应该是件值得高兴的事情。」

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

总体而言,参与者对 Keyframer 的使用体验感到满意。参与者给出的平均分数为 3.9 ,介于满意 (4) 和中立 (3) 之间。参与者生成了 223 种设计。平均来看,每位参与者生成 17.2 个设计。图 8 显示了两个参与者的最终动画示例。

一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果

更多技术细节请参阅原论文。

以上就是一句话让图片动起来,苹果发力大模型动画生成,可直接编辑结果的详细内容,更多请关注其它相关文章!


# ai  # 数据  # 上饶营销型网站建设价格  # 表白网站建设  # 语言推广新闻网站  # 健康平台网站建设  # 洋鑫网站seo博客  # 做优化的网站设计模板图  # 网易关键词排名代发  # 大庆网站建设很棒  # LES网站建设美丽  # 苏州农产品营销推广中心  # 所示  # 如图  # 用户可以  # 新能源  # 多个  # 自然语言  # 编辑器  # 力大  # 可直接  # 句话  # midjourney  # sora 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 哪个品牌有折叠屏手机卖  哪些框架支持typescript  怎么在typescript写原型链  ftp$如何执行宏命令  折叠屏手机为什么凉凉  vs如何输入命令行参数  市盈率pe是什么意思  摩托车上power是什么意思  建伍遥控器power是什么意思  如何通过命令检测u盘启动  春运哪天抢票最好  命令行如何打开文件  阿里云盘扩容工具怎么用  2026年将会大爆发的15个新科技  单片机怎么计算0xf0  solo交友软件怎么恢复聊天记录  为什么选择typescript  vi命令如何使用方法  为什么夸克运行不了  j*a怎么清除数组  linux如何合并分区命令  vue组件typescript怎么用  命令行ftp如何创建目录  r中如何逐行执行命令  如何提高固态硬盘性能  新装固态硬盘如何安装  typescript数据怎么写  win7旗舰版wifi怎么打开  折叠屏手机哪个牌子性价比高  苹果16关闭哪些功能好  什么是typescript  关系型数据库和非关系型数据库有哪些  typescript怎么拼接  python 如何执行linux命令  复制 命令如何撤销  春运抢票到哪里抢票啊  typescript如何开发  摄像机的power chg是什么意思中文  万能表上的power是什么意思  win7怎么做幻灯片  如何显示固态硬盘  drawing是什么意思  typescript掌握哪些可以做项目  油烟机上的power是什么意思  shell如何执行sql脚本命令行  萝卜快跑的收费标准是什么  苹果手机16有哪些功能  linux如何切换到命令行模式  如何修改域名解析  shell如何注释所有命令 

搜索