Share these blogs with friends

2026

June

AI HOT 日报 · 2026-06-25

AI HOT 日报 · 2026-06-25 模型发布/更新 OpenAI ChatGPT 语音最大规模升级:双向AI语音模型 Bidi 1 已上线测试 — IT之家(RSS) 6月23日,部分用户反馈 ChatGPT 网页版和 App 版上线了双向 AI 语音模型 Bidi 1,位于设置模型选择器中,与标准语音和高级语音并列。该模型支持边说话边监听,用户可在对话中途打断并发出新指令,例如要求从1数到10时中途喊停倒数,模型会立即切换执行。OpenAI 尚未官宣,预计本周启动更大范围测试。 https://www.ithome.com/0/967/852.htm Qwen-AgentWorld 开源:让 Agent 学会“先预测,再行动” — 公众号:通义实验室(千问) 通义千问推出首个原生语言世界模型 Qwen-AgentWorld,覆盖 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域。模型基于超 1000 万条真实交互轨迹,经 CPT→SFT→RL 三阶段训练,在 AgentWorldBench 上超越 GPT-5.4(58.25)和 Claude Opus 4.8,Qwen-AgentWorld-397B-A17B 取得 58.71 分。两种范式已验证其能力:作为解耦环境模拟器实现可控 Sim RL,在 WideSearch 上超越真实环境 RL(F1 50.3% vs 45.6%);作为智能体基础模型,LWM 预热可迁移至七个基准(三个完全未出现在训练… https://mp.weixin.qq.com/s/NV9WGpGsfFz35jww5agM9g Gemini 3.5 Flash 中的计算机使用 — Hacker News 热门(buzzing.cc 中文翻译) Google 将计算机使用(Computer use)作为内置工具集成至 Gemini 3.5 Flash,使开发者能构建跨浏览器、移动端和桌面环境的智能体。此前该功能仅作为独立模型在 Gemini 2.5 中提供,现已原生整合至主 Flash 模型。开发者可通过 Gemini API 及 Gemini Enterprise Agent Platform 调用。安全方面,模型采用针对性对抗训练降低提示注入风险,并新增两项可选企业级保护:要求用户确认敏感操作、检测到间接提示注入时自动停止。该能力在持续软件测试、跨应用知识工作等长周期企业自动化场景中表现更优。(198字) https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash ...

June 25, 2026 · Liam DING

AI HOT 日报 · 2026-06-24

AI HOT 日报 · 2026-06-24 模型发布/更新 FastWan-QAD:单卡5090上1.8秒生成5秒视频 — X:Sky Computing Lab (@haoailab) Sky Computing Lab 发布 FastWan-QAD 视频生成模型系列,基于 FastVideo 的量化感知蒸馏(QAD)方案训练。在单张 NVIDIA GeForce RTX 5090 上,端到端生成一段 5 秒 480P 视频仅需 1.8 秒。模型、代码及博客已开源。 https://x.com/haoailab/status/2069493820732170695 京东全栈开源JoyAI-VL-Interaction,从“一问一答”走向“边看边说” — 公众号:京东JoyAI 京东近日开源全球首个全栈交互模型JoyAI-VL-Interaction,获vLLM-Omni原生支持。该模型能持续观察视频流、主动判断关键事件并实时响应,支持将复杂任务委托后台Agent处理。在58个真人盲评中,对比豆包视频通话助手胜率77.6%,对比Gemini视频通话助手胜率87.9%,监控预警场景达100%胜率。开源内容包括模型权重、交互数据集、训练方案及完整可部署系统,支持摄像头、直播流等视频输入及语音交互、长期记忆、vLLM部署,适用于安防监控、老人看护、直播讲解等实时场景。 https://mp.weixin.qq.com/s/IY6XGp4k6VgD9ZPH6YprCA 网易有道发布 Confucius4-TTS:14 语种跨语种无口音语音克隆开源模型 — IT之家(RSS) 网易有道推出“子曰 4.0”TTS 引擎 Confucius4-TTS,声称是业内首个支持 14 种语言跨语种无口音、且无需参考文本即可完成语音克隆的开源模型。用户仅需 3 秒音频即可实现零样本音色克隆,克隆音色与原声相似度超 85%,任务准确度达 97%。模型支持中文、英语等 14 种语言,首创音频 Prompt 情感克隆迁移。底层采用 GPT 式语义大模型、SSL 预训练特征与 ECAPA-TDNN 说话人编码器、Flow Matching 框架。已全量开源(Apache 协议),提供 54GB 资源包供本地部署。 https://www.ithome.com/0/967/636.htm Krea 2 技术报告正式发布 — X:Krea AI (@krea_ai) 我们的技术报告已发布。 深入解析创建 Krea 2 所用的数据、架构及训练技巧。 https://www.krea.ai/blog/krea-2-technical-report https://x.com/krea_ai/status/2069473417804591191 ...

June 24, 2026 · Liam DING

AI HOT 日报 · 2026-06-23

AI HOT 日报 · 2026-06-23 模型发布/更新 PP-OCRv6 on Hugging Face:50 语言 OCR,参数规模 1.5M 至 34.5M — Hugging Face:Blog(RSS) PP-OCRv6 是 PaddleOCR 最新一代通用 OCR 模型族,提供 tiny(1.5M)、small(7.7M)和 medium(34.5M)三级。medium 和 small 支持 50 种语言(简体/繁体中文、英文、日文及 46 种拉丁语系)。在官方多场景基准上,medium 检测 Hmean 86.2%,识别准确率 83.2%,较 PP-OCRv5_server 分别提升 +4.6 和 +5.1 个百分点。模型采用 PPLCNetV4 统一骨干、RepLKFPN 检测模块和 EncoderWithLightSVTR 识别模块,可通过 PaddleOCR、Transformers、ONNX Runtime 等后端灵活部… https://huggingface.co/blog/PaddlePaddle/pp-ocrv6 产品发布/更新 东京 AI 公司 Sakana AI 推出多智能体编排系统 Sakana Fugu — X:Berry Xia (@berryxia) Sakana AI 是 2023 年成立于东京的 AI 公司,由前 Google Brain 的 David Ha(CEO)、Transformer 论文共同作者 Llion Jones(CTO)及前日本外交官 Ren Ito(主席)联合创立。其产品 Sakana Fugu 将多智能体系统封装成单个 API 调用,内部自动拆解任务、调度全球模型并验证结果。Fugu Ultra 在工程、科学、推理等基准上对标 Fable/Mythos,通过动态编排多模型天然绕开单一供应商出口管制风险,被视为将多智能体从复杂工程变为开箱即用的产品形态。 https://x.com/berryxia/status/2069090959938466298 ...

June 23, 2026 · Liam DING

AI HOT 日报 · 2026-06-22

AI HOT 日报 · 2026-06-22 产品发布/更新 美团tabbit国际版免费接入GPT-5.5/Claude Opus 4.8等旗舰模型 — X:阿易 AI Notes (@AYi_AInotes) 美团近期上线tabbit国际版应用,免费集成多家顶级AI模型的最新旗舰版,包括GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash,以及国内Kimi-2.6、GLM-5.1、MiniMax-M3。用户无需单独订阅即可使用这些模型。需注意:只有国际版包含海外模型,国内版仅提供国内模型。该应用旨在抢占AI入口,目前处于免费推广阶段。 https://x.com/AYi_AInotes/status/2068637890247016607 行业动态 NSA局长:Mythos数小时内攻破其几乎所有机密系统 — X:AI Safety Memes (@AISafetyMemes) 美国NSA局长称,Mythos在数小时内攻破了其几乎所有机密系统。此前Mythos已在5天内破解MacOS。而顶级漏洞团队Google Project Zero完成同等攻击需6个月,单个MacOS零日漏洞价值约200万美元。苹果原假设全球仅10-20个团队具备此能力,Mythos将使该数字增至数千。全球约20亿活跃苹果设备中,Mac用户多为记者、高管、政府官员等高价值目标,苹果曾是“最安全”的选择。 https://x.com/AISafetyMemes/status/2068718552174252477 三星电子向全球员工部署ChatGPT Enterprise和Codex — OpenAI:官网动态(RSS · 排除企业/客户案例) 三星电子向全球员工推出ChatGPT Enterprise和Codex,这是OpenAI目前规模最大的企业级AI部署之一。 https://openai.com/index/samsung-electronics-chatgpt-codex-deployment 技巧与观点 腾讯元宝父亲节活动:上传照片生成与年轻爸爸的合影 — 公众号:腾讯元宝 腾讯元宝推出父亲节主题活动,用户可选择爸爸年轻时照片与自己的照片,输入提示词(如“帮我生成一张和爸爸的合影,将图2的我融合到图1爸爸的照片中,我想穿越回__年前,和他一起_____;保留爸爸照片的背景、动作及五官;人物姿态自然协调,整体光线与色调保持一致”),元宝即可生成合影。活动旨在让用户“回到过去”看到爸爸的青春模样。 https://mp.weixin.qq.com/s/xrTg2Bdy3FF3gn3C_gVBJQ 数据来自 aihot.virxact.com,由 OpenClaw 自动推送。

June 22, 2026 · Liam DING

AI HOT 日报 · 2026-06-21

AI HOT 日报 · 2026-06-21 行业动态 微软双向转售GPT与DeepSeek成全球最大AI中间商 — X:阿易 AI Notes (@AYi_AInotes) 彭博社报道,微软已成为全球最大AI模型中转站,既将ChatGPT卖给中国企业,也反向将DeepSeek模型卖给西方客户。报道称微软正在测试DeepSeek-R1和DeepSeek-V4,计划向西方客户提供这些中国模型。这一模式构建起跨中美AI模型的双向贸易网络。 https://x.com/AYi_AInotes/status/2068218661710512231 技巧与观点 开源教程《Deep Agents 实战》发布 — X:邵猛 (@shao__meng) LangChain 官方认证大使 @zhanghaili0610 推出开源教程《Deep Agents 实战》,基于 LangChain / LangGraph 生态,讲解如何用 Deep Agents Harness 框架构建真实 Agent 应用。核心是“三层架构”:Runtime(LangGraph)、Framework(LangChain)、Harness(Deep Agents)。技术内核为上下文工程,通过虚拟文件系统实现按需读取、中间结果落盘、大文件局部读取。教程共 8 章 + 2 准备篇,覆盖虚拟文件系统(六大工具)、任务规划、子 Agent 委派(异步并行)及 Skills 复用(可在 Claude Code、Cur… https://x.com/shao__meng/status/2068306942184034471 数据来自 aihot.virxact.com,由 OpenClaw 自动推送。

June 21, 2026 · Liam DING

AI HOT 日报 · 2026-06-20

AI HOT 日报 · 2026-06-20 产品发布/更新 阿里开源向量数据库Zvec,UCSD黄碧薇教授提出因果AI第四代范式 — X:阿易 AI Notes (@AYi_AInotes) 阿里开源内部向量数据库Zvec,pip install zvec免费使用,对标Pinecone每月70美元能力。支持十亿向量毫秒级检索,无需单独起服务,全平台兼容;v0.5.0新增原生全文混合搜索。UCSD黄碧薇教授(causal-learn作者)提出AI四代范式:相关性小模型→因果小模型→相关性大模型(LLM)→因果大模型,认为当前正站在第四代门口。其创立的Aether AI完成首轮融资,致力于从视频中自动抽取物理规律,探索下一代因果AI范式。 https://x.com/AYi_AInotes/status/2067832098816250346 NVIDIA Research 发布 SpatialClaw:免训练空间推理框架 — MarkTechPost(RSS) NVIDIA Research 发布 SpatialClaw,一个免训练的空间推理框架。它通过将代码作为动作接口,让智能体调用感知工具(Depth Anything 3、SAM 3)并自由组合输出,解决视觉语言模型在 3D 空间判断上的弱点。在 20 项基准测试中平均准确率达 59.9%,比近期智能体 SpaceTools 高 11.2 个百分点,比无工具基线高 6.5 点,比结构化工具调用高 3.2 点。框架无需重新训练,同一提示词和工具集可跨所有基准和骨干网络运行,支持 Qwen3.5/3.6 及 Gemma4 等 26B 至 397B 参数的模型。 https://www.marktechpost.com/2026/06/19/nvidia-ai-introduce-spatialclaw-a-training-free-agent-that-treats-code-as-the-action-interface-for-spatial-reasoning Cloudflare 为 AI 智能体推出临时账户 — Cloudflare Blog Cloudflare 在 Workers 上推出临时账户(Temporary Accounts),允许 AI 智能体直接运行 wrangler deploy --temporary,在数秒内获取一个可用的实时 Worker,无需绕开面向人类设计的部署流程。该功能旨在降低智能体部署门槛。 https://blog.cloudflare.com/temporary-accounts Claude Code v2.1.183 发布 — Claude Code:GitHub Releases(RSS) Claude Code v2.1.183 增强了自动模式安全性:未经请求时阻止 git reset --hard、git commit --amend(非本轮提交)、terraform destroy 等破坏性命令。新增 attribution.sessionUrl 设置,可省略 claude.ai 会话链接;/config --help 列出所有速记键;/config 切换行为改为 Enter/Space 变更、Esc 保存退出。修复了 thinking 块导致 400 错误、子智能体 WebSearch 空结果、vim 模式光标滞留、Windows Terminal TUI 错乱、多插件技能重复、MCP … https://github.com/anthropics/claude-code/releases/tag/v2.1.183 ...

June 20, 2026 · Liam DING

AI HOT 日报 · 2026-06-19

AI HOT 日报 · 2026-06-19 模型发布/更新 首个统一科学大模型 LOGOS 正式开源 — 公众号:通义实验室(千问) LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域专用方法:口袋条件配体生成纯序列范式首次超越3D扩散模型,超越NatureLM(8×7B);逆合成预测Top-1准确率74.8%;口袋位点识别仅靠序列达58.5% Top-n准确率;MOF材料生成NBB提升至17.78%。模型采用统一词汇表将蛋白质、小分子等编码为离散Token,通过空间交互离散化实现无需3D坐标的序列预测。预训练与下游任务形式与目标一致,跨领域知识迁移经实验验证有效。已完整开源模型权重、推理代码与技术报告。 https://mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg 火山引擎上线豆包实时语音模型3.0 API 服务,开启邀测 — 公众号:火山引擎 火山引擎上线豆包实时语音模型3.0(Seeduplex)API 服务并开启邀测。该模型为原生全双工端到端语音大模型,具备精准遵循、抗干扰、动态判停三大优势。可在多人对话中安静待命,指定话题出现时主动加入;支持通过自定义工具在实时交互中完成预定日历、发送邮件等任务。抗干扰力提升,误回复率与误打断率大幅降低;判停延迟缩短约250ms,复杂场景抢话比例下降40%,用户主动打断延迟缩短约300ms。适用于汽车智能座舱、智能硬件、智能客服等场景。 https://mp.weixin.qq.com/s/L4BJnexabQu5DAxDnwEGxw Grok TTS 盲测人类感得分96登顶 — X:xAI (@xai) xAI 的 Grok TTS 模型在 @Vapi_AI 的 Humanness Index 盲测中以 96 分(真人 100 分)位居榜首。该指数选取同一声音和引文,经各模型克隆后由听众盲评。 https://x.com/xai/status/2067654108123910495 产品发布/更新 GPT-5.5 Instant提升ChatGPT健康智能 — OpenAI:官网动态(RSS · 排除企业/客户案例) 每周超2.3亿用户通过ChatGPT获取健康信息。GPT-5.5 Instant在健康评估中表现显著提升,最具挑战性评测上达到前沿Thinking模型水平,已面向所有免费用户开放。基于医生编写的HealthBench和HealthBench Professional评估,其回复在准确性、安全性和沟通质量上优于医生手写回复及早期模型,故障模式发生率更低。近两个月生产流量显示,健康类回复事实性问题率下降71%。 https://openai.com/index/improving-health-intelligence-in-chatgpt OpenAI 联合多国医生:GPT-5.5 Instant 健康问答能力追平前沿 Thinking 模型 — X:Greg Brockman (@gdb) OpenAI 与全球 60 个国家、49 种语言、26 个专科的数百名医生合作,通过医生主导的评估大幅提升了 GPT-5.5 Instant 在健康相关问题的智能水平,现已能与公司前沿 Thinking 模型(推理模型)相当。该模型每周为超过 2.3 亿 ChatGPT 用户服务,能更好识别紧急医疗需求、询问相关上下文、解释不确定性并简化复杂信息。由于面向所有 ChatGPT 免费用户开放,这些改进可惠及更多人。 https://x.com/gdb/status/2067675030335668270 ...

June 19, 2026 · Liam DING

AI HOT 日报 · 2026-06-18

AI HOT 日报 · 2026-06-18 模型发布/更新 MolmoMotion:语言引导的3D运动预测模型 — Hugging Face:Blog(RSS) MolmoMotion基于Molmo 2骨干网络,输入视频帧、物体上的3D点标记及文字动作指令(如“移动并旋转桌上放水果的木碗”),预测未来数秒内这些点的3D轨迹。提供两个变体:自回归的MolmoMotion-AR逐步预测坐标,流匹配的MolmoMotion-FM通过连续空间变换处理多可能性运动。同时发布MolmoMotion-1M数据集(含116万视频的3D点轨迹及动作描述)和PointMotionBench基准测试(2700个人工验证视频片段)。模型权重、数据集和基准测试均已开源。 https://huggingface.co/blog/allenai/molmomotion Grok 4.3 在 Amazon Bedrock 正式可用 — xAI:News(网页) 6 月 17 日,xAI 宣布 Grok 4.3 在 Amazon Bedrock 上全面可用。该模型在前沿模型中达成最低幻觉率,支持 100 万 token 上下文窗口,并提供可配置推理努力(none/low/medium/high)。在 Artificial Analysis Omniscience 基准排名第一,在 Tau2 Telecom 基准评估客服智能体真实工具调用性能排名第一,在 Vals AI Case Law 和 Corporate Finance 基准的复杂文档理解任务排名第一。定价为输入每百万 token 1.25 美元、输出每百万 token 2.50 美元,每美元智能度是其他前沿模型的 2–10 倍。 https://x.ai/news/grok-amazon-bedrock 产品发布/更新 Vercel 发布开源 AI 智能体框架 Eve:每个智能体就是一个文件目录 — MarkTechPost(RSS) Vercel 发布开源 AI 智能体框架 Eve(npm 包,Apache-2.0 许可)。Eve 采用文件系统优先设计:每个智能体对应一个磁盘目录,目录结构直接映射模型、指令、工具、技能、连接、子智能体等能力,无需额外注册代码。内置六大生产级能力:持久执行(每步检查点,崩溃后可恢复)、沙箱计算、人机审批、安全连接(支持 MCP 和 OpenAPI)、多通道(Slack、Discord、Teams 等)以及追踪与评估(OpenTelemetry)。Vercel 内部运行了上百个智能体,包括数据分析工具 d0(月处理超3万查询)、自动销售代理 Lead Agent(年费约5000美元、回报32倍)和支持智能体 Vertex(自主解决9… https://www.marktechpost.com/2026/06/17/vercel-releases-eve ...

June 18, 2026 · Liam DING

AI HOT 日报 · 2026-06-17

AI HOT 日报 · 2026-06-17 模型发布/更新 Cartesia 发布 Sonic 3.5 与 Ink 2 实时语音模型 — X:Testing Catalog (@testingcatalog) Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。Ink 2 在 Artificial Analysis 的流式语音转文字排行榜上排名第一。Sonic 3.5 在实时文本转语音中位列榜首,首音频延迟约 82ms。Cartesia 成为目前唯一同时拥有 #1 听与说模型的提供商。 https://x.com/testingcatalog/status/2066773392527655252 Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力 — Qwen:Blog Retrieval(API) Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道… https://qwen.ai/blog?id=qwen-robotmanip ...

June 17, 2026 · Liam DING

AI HOT 日报 · 2026-06-16

AI HOT 日报 · 2026-06-16 模型发布/更新 MiniMax 开源 M3 模型权重及 MSA 技术论文 — 公众号:MiniMax(稀宇科技) MiniMax 上周五开源了 428B 总参数、23B 激活参数的 M3 模型权重,同步发布 MSA(MiniMax Sparse Attention)技术论文,该架构显著降低长上下文计算成本。M3 是首个从预训练阶段就进行文本、图像等多模态交错混合训练的开源模型。发布两周后,M3 在 Artificial Analysis 综合智能指数、GDPval-AA 排行榜均获开源模型第一,Code Arena WebDev 跻身帕累托最优序列,Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升至约 80 TPS,计划再提速 30–40%;Token Plan 后台新增调用量看板。 https://mp.weixin.qq.com/s/AW6L89QZkwN-jD27hQ84ww 下一代投机解码:DFlash 与 Spec V2 — LMSYS:Blog(Chatbot Arena 团队) Z Lab、Modal 与 SGLang 团队联合发布 DFlash 投机解码模型和 SGLang 的默认 Spec V2 引擎。DFlash 采用块扩散+KV 注入并行生成整块 draft token,在 Qwen 3.5 397B-A17B(BF16)的 HumanEval 数据集上、并发 1 时吞吐量达到基线的 4.3 https://www.lmsys.org/blog/2026-06-15-next-generation-speculative-decoding-dflash-v2 ...

June 16, 2026 · Liam DING