欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。

1、黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型

黑森林实验室发布的Flux3多模态基础模型,首次实现了原生音频生成,并在音视频同步、图像生成和动作控制方面表现出色,展现了其在人工智能领域的领先地位。

image.png

【AiBase提要:】

🧠 Flux3是首个支持原生音频生成的多模态基础模型,能够一次生成20秒的音视频同步片段。

📊 在早期测试中,Flux3在多个基准测试中表现优于其他顶尖模型,如Luma Ray3.2和Runway Gen-4.5。

🤖 Flux3还与Mimic Robotics合作开发了面向机器人领域的动作模型Flux-mimic,已在奥迪工厂进行生产任务测试。

2、Claude Opus现已支持语音模式:从随口问答升级成能调工具、换语言的实时参谋

Claude 语音模式的升级显著提升了其处理复杂问题的能力,同时增加了对多种模型和工具的支持,使用户能够更高效地利用语音交互完成任务。

image.png

【AiBase提要:】

🧠 Claude 语音模式升级,支持 Opus、Sonnet 和 Haiku 模型,提升复杂问题处理能力。

🛠️ 支持连接 Gmail、Slack 等工具,实现语音指令执行任务,如修改日程、生成文档等。

🌐 扩展多语言支持,允许用户在对话中切换语言,但需手动设置。

3、快手入局AI互动内容赛道,开放首批创作者招募

快手正式宣布推出‘AI互动内容’创作功能,标志着短视频平台竞争从传统内容时长延伸至交互式体验领域。该功能依托大模型,允许用户通过文字输入、选项选择主动参与内容走向,打破传统短视频单向传播模式。业内分析认为,这是快手在短视频存量竞争下的关键落子,旨在提升用户留存和推荐算法反哺。

【AiBase提要:】

🤖 快手推出AI互动内容创作功能,开放首批合作创作者招募。

🕹️ AI互动内容依托大模型打造,用户可主动参与内容走向,打破传统短视频单向传播模式。

📈 业内分析认为,快手此举是在短视频存量竞争下的关键落子,旨在提升用户留存和推荐算法反哺。

4、小鹏人形机器人广州工厂开启小批量试生产 预计2026年实现量产

小鹏人形机器人广州工厂正式开启小批量试生产,标志着其量产冲刺进入倒计时。公司计划在2026年实现量产,并逐步应用于全球门店及商业场景,通过整合集团核心能力加速商业化落地。

【AiBase提要:】

🚀 小鹏人形机器人在广州工厂开启小批量试生产,量产产线进入最后联调阶段。

💼 小鹏集团董事长何小鹏亲自兼任机器人业务CEO,推动商业化落地进程。

🌐 小鹏计划在2026年实现人形机器人量产,并逐步进驻全球门店及商业场景。

5、腾讯混元合二为一:多模态与大语言模型部门合并,姚顺雨统管冲全模态上限

腾讯宣布将混元多模态模型部门与大语言模型部门合并,设立基础模型部,由姚顺雨统一管理。此举旨在提升模型研发与协同效率,探索全模态模型的智能上限。

【AiBase提要:】

🧠 腾讯将混元多模态模型部门与大语言模型部门合并,设立基础模型部,由姚顺雨统一管理。

🚀 合并旨在提升模型研发与协同效率,探索全模态模型的智能上限。

📊 姚顺雨此前已兼任大语言模型部负责人,此次合并标志着腾讯在混元技术路线上的进一步整合。

6、微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布:不蒸馏第三方,已落地Bing和PowerPoint

微软推出自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,分别面向高质量图像生成和高并发语音交互场景,强调训练数据可追踪且不依赖第三方模型蒸馏。两款模型已在多个产品中落地,并显著提升了效率和成本效益。

image.png

【AiBase提要:】

🧠 MAI-Image-2.5-Pro是微软自研的高精度图像生成模型,支持自然语言编辑指令,已在Bing Image Creator和PowerPoint中应用。

🔊 MAI-Voice-2-Flash是优化的语音模型,速度提升2倍,成本降低32%,已应用于T-Mobile等客户。

📊 MAI-Transcribe-1.5已用于医疗解决方案,处理2800万次患者问诊记录,支持58种语言,错误率下降50%。

7、腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

腾讯推出 WorkBuddy Bench 多领域评测套件,涵盖代码、网页、办公和安全四个领域,任务均从真实场景逆向工程而来,防止背答案。评测方式多样,强调抗污染能力,并公开数据集以提升透明度。

【AiBase提要:】

📌 WorkBuddy Bench 跨越代码、网页、办公和安全四大领域,共260个任务,防止背答案。

💡 每个任务均从真实场景逆向工程生成,确保任务提示词无法通过网络搜索获取。

🔒 评测采用多维度评分机制,包括规则检查、LLM/VLM 评判及智能体评判,确保公平性。

8、阿里开源0.8B文档解析模型OvisOCR2,端到端方案登顶OmniDocBench

阿里开源的OvisOCR2模型在文档解析领域取得重大突破,以0.8B参数规模实现端到端解析,超越传统流水线方法,为RAG检索、智能问答和企业知识库提供高效支持。

image.png

【AiBase提要:】

✅ OvisOCR2是首个全面超越传统流水线方法的端到端文档解析模型。

💡 模型结合真实与合成数据,通过多种技术手段提升性能。

🚀 该模型已开源,兼容主流推理框架,降低高精度文档解析门槛。