标签:多模态
Gemini 3.0还在预热,中国AI抢先!30秒造APP全网首测
AI技术正经历从单一模态生成向「生成涌现」的深刻范式转变。谷歌Gemini 3.0未正式发布便已通过实测展示其革命性能力,包括一键生成操作系统界面、可交互网页...
对话Memories.ai:“人的记忆本质上是视觉,AI也该如此”
Memories.ai公司由前Meta研究员Shawn Shen和Ben Zhou创立,专注于开发大型视觉记忆模型(LVMM)。其核心技术创新在于将原始视频转换为设备上的结构化内存,通...
这可能是今年最能打的 ToC Agent 产品。
作者通过亲身体验,尖锐批评了当前AIGC产品过度强调生成能力而忽视编辑体验的行业现象。以百度GenFlow为例,指出优秀产品应聚焦用户实际需求,将AI能力与专业...
与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本
在 NeurIPS 2025 论文中,来自南京理工大学、中南大学、南京林业大学的研究团队提出了一个极具突破性的框架 ——VIST(Vision-centric Token Compression in LL...
OpenAI引爆新赛道:AI不再卖技术,而是卖「活人感」!
一段小女孩与AI玩具告别的视频引发了广泛关注,揭示了对话式AI如何深度融入人类情感世界。这一场景不仅触动了公众情感,更凸显了实时交互技术的革命性潜力。...
美团开源全模态,比肩顶级闭源模型,开源新SOTA
美团LongCat团队发布了5600亿参数的开源全模态模型LongCat-Flash-Omni,该模型能够实现毫秒级的实时音频-视觉交互。其核心是一个端到端的全模态架构,能够接...
刚刚,AI视频的天花板被掀翻!测完SkyReels后飘了:我亦有成为专业导演的潜质
昆仑万维近日推出全新升级的AI视频创作平台SkyReels,标志着多模态内容生成技术进入新阶段。该平台通过'模型+平台'双轨模式,集成图像、音频、视频、数字人等...
美团新独立APP,点不了菜只能点AI
美团最新开源的多模态模型LongCat-Flash-Omni实现了全模态实时交互能力,在Omni-Bench等综合性基准测试中超越同类开源模型,达到与闭源Gemini-2.5-Pro相当的...
AI深度应用关键元年,快手重塑内容与商业价值
2025年被广泛视为AI深度应用的关键转折点,多模态生成与Agent技术正推动AI向更高效、更贴合用户需求的方向发展。在这一背景下,快手作为以技术驱动的科技公司...
智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化
北京智源人工智能研究院发布了大规模多模态世界模型“悟界·Emu3.5”,该模型在模拟复杂物理世界方面展现出惊人的逼真度,并揭示了“多模态Scaling范式”的存在。...





