近日,谷歌的全新人工智能模型 Gemini 1.0 引起了广泛的关注。Gemini 到底是个什么样的模型,为什么说比 GPT-4 强呢?
Gemini 是谷歌推出的一种大型语言模型。它是谷歌迄今为止规模最大、能力最强的人工智能模型,具有原生多模态能力,能够同时处理文本、图像和音频等多种信息。
Gemini 的训练数据集包括1.6万亿个参数,是之前的 GPT-3 的两倍。它能够理解和生成自然语言,并能够从文本、图像和音频中提取信息。
Gemini 还能够进行多种任务,包括: 生成文本、翻译语言、编写不同类型的创意内容等。 理解和回答问题,包括开放式、挑战性的和奇怪的问题。 从文本、图像和音频中提取信息,并进行分析。
Adobe 将于下周的 Adobe Max 活动中宣布推出一款新的AI照片编辑工具 Project Stardust。Adobe近日也提前曝光了Stardust的实测视频。
从视频中可以看出,Stardust强大的AI编辑功能,如用户可选择单张照片中的对象进行准确的识别和编辑。用户只需点击所选对象,就能轻松完成图片的处理。Stardust尤其适用于电商平台,它可以快速检测图片中的元素,并通过AI算法生成新的图片元素,极大地提升了工作效率。
这会改变我们与 Adobe 产品交互的方式吗?
今天我要推荐的网站,能为你提供未来感十足的AI网站生成体验!
Framer 由Koen Bok和Jorn van Dijk于2014年创立。他们曾在Facebook和Hype进行产品设计和开发,看到现有设计工具无法满足创建复杂互动原型的需求,于是创立了Framer。当下,Framer已经成为设计和开发领域的重要工具。
虽然在实时协作和矢量设计方面,Figma等竞争对手更具优势,但Framer凭借其在互动原型和动画方面的强大功能,保持了在设计工具市场中的重要地位。
✨ Framer亮点 ✨ ① 无代码设计:你无需编程基础,通过拖放组件即可创建复杂的交互效果。 ② 实时协作:多人同时编辑和评论,团队合作更加高效流畅。 ③ 自动化设计:智能布局和响应式设计功能,让你的作品在任何设备上都完美呈现。这也是最打动我的一点。现在大大小小的设备太多了,能做到多端适配,简直感动到哭。 ④ 丰富的模板和组件:海量模板和UI组件库,助你快速启动项目,节省时间。 ⑤ 高保真原型:从静态设计到动态原型,一气呵成,完美展示用户体验。
官网地址:Framer
看到 Niji 发布的预告来演示局部重绘(inpaint)的效果,是 Midjourney 即将发布局部重绘功能,对于MJ的AI绘画最头痛就是生成一张图片,如果只有细节不满意就要重新抽卡生成,这样导致很多不可控的效果出来而且浪费时间,而即将推出的Inpainting(局部重绘)功能就很好解决这个问题。
这个新功能就像 PS 的AI一样,只需要涂抹一个区域,然后加入关键词就能重新绘制或替换这个区域。至少再也不用担心出现 3 只手,6 根手指头的情况了。有没有小伙伴有内部的消息,Midjourney AI 创意局部重绘功能什么时候能上线啊?
大家好,昨天给大家推荐了一款线上的AI图像编辑工具,不知道大家用过没有。今天再给大家推荐一款功能更加强大的AI图像编辑工具:EditAnything
EditAnything 是一款基于Segment-Anything、ControlNet、StableDiffusion等技术的在线AI图像编辑工具,能够对图像进行多种修改和生成操作。它具备跨图像区域拖拽合并的能力,让用户能够自由发挥创意进行融合。
除了对图像中的物体进行修改、添加、删除等操作,还可以通过调整细节和布局来创造出不同风格的图像。EditAnything还提供了多种高品质角色编辑功能,包括衣服、发型、美瞳等。还可以通过绘制草图来生成图像,为创作提供更多可能性。感兴趣的小伙伴可以试试效果哦!
前段时间,Firefly发布了一项新功能,名为“生成式填充”,可帮助用户轻松去除或修改图像内容,同时还能扩展图像内容。在Photoshop Beta测试版中,用户可以非破坏性地组合或生成图像。我利用这项功能对9张剧照进行了调整,效果非常惊艳,你最喜欢哪一款呢? Adobe Firefly 的 Generative Fill 包括三个主要功能:添加新内容到图像中,删除或替换图像的一部分内容,以及通过向外扩展图像来增加其尺寸。前两个功能已经在 Adobe Firefly 中实现,而最后一个功能目前只能在 Photoshop 的测试版中使用。
太震撼了啊,没等到GPT-5,却迎来了 OpenAI 新旗舰模型GPT-4o!
5月14日凌晨,GPT-4o 在 OpenAI 官网正式发布了,GPT-4o是一个多模态模型,能够处理视频、音频和文本数据,具有实时推理的能力。它能够执行多种任务,包括实时翻译、唱歌、做数学题和讲笑话等。GPT-4o的语音响应时间非常短,平均响应时间为320毫秒,并且在MMLU评测中创下了88.7%的新高分,超过了其他市面上的大模型。
这是正儿八经的原生多模态,更重要的是可以实时推理音频、视觉和文本,注意这里是实时,实时,实时,推理的不是文本,是音频!视觉!
某种程度上,AGI 已然成为现实,我们即将迎来一个新的时代啊!
字节跳动的研究人员开发了一种超高清文生视频模型MagicVideo-V2。
这是一个集成了文本到图像模型、视频运动生成器、参考图像嵌入模块和帧插值模块的端到端视频生成pipeline。MagicVideo-V2能够从文本描述中生成具有高美感、高分辨率、高保真度和流畅性的视频。通过大规模用户评估,它在人类视觉感知方面表现出优秀的性能。
MagicVideo-V2的设计包括以下关键模块: - 文本到图像模型:从给定的文本提示生成一个1024×1024的图像作为视频生成的参考图像。 - 图像到视频模型:使用文本提示和生成的图像作为条件生成关键帧。 - 视频到视频模型:对关键帧进行细化和超分辨率处理,生成高分辨率视频。 - 视频帧插值模型:在关键帧之间插值生成平滑的视频运动,并最终生成高分辨率、流畅、高美感的视频。
论文地址:https://arxiv.org/abs/2401.04468 项目地址:https://magicvideov2.github.io/