开发者用 MiniCPM-o 4.5 打造实时语音预约智能体
开发者 @mrgoodmantweets 基于 MiniCPM-o 4.5 构建了开源预约智能体 MiniCPM-o Booking Desk,将模型置于实时全双工交互流程的核心。该智能体可边听边说,同时从操作员屏幕读取实时预约状态并完成任务,实现多模态感知与对话的联动。交互由模型驱动并配合确定性状态控制,预约确认前需用户确认。
按来源浏览
开发者 @mrgoodmantweets 基于 MiniCPM-o 4.5 构建了开源预约智能体 MiniCPM-o Booking Desk,将模型置于实时全双工交互流程的核心。该智能体可边听边说,同时从操作员屏幕读取实时预约状态并完成任务,实现多模态感知与对话的联动。交互由模型驱动并配合确定性状态控制,预约确认前需用户确认。
X上的社区笔记正越来越多地被AI反对者和政治活动人士滥用。一旦某条AI相关推文走红(浏览量>50万),就有可能被贴上笔记,即便内容平淡无争议。
通义千问发布 Qwen-Image-2.1,vLLM-Omni 提供 day-0 支持。该模型可在一个模型内完成图像生成、编辑和透明图像输出,由 7.1B DiT 搭配 Qwen3-VL-8B 组成,设置和受支持的组合见 https://recipes.vllm.ai/Qwen/Qwen-Image-2.1。
原文引用 Jev 完成大规模广告分析的演示,Token 成本仅 9 美分,即将在 StealAds + MCP 中可用。
Jev 仅用 40 秒分析 37 个品牌的 724 条广告,提取钩子、形式、Offer、CTA 等细节,Token 成本 0.09 美元,即将接入 StealAds + MCP。
通义千问发布 Qwen-Image-2.1,定位为 Qwen-Image 系列中均衡且高性价比的图像生成模型,现已开放权重。该模型为生成与编辑一体化的 7B 轻量架构,原生支持生成和编辑 RGBA 透明图层,编辑支持最多 10 张参考图和精确局部控制,并擅长全景图、信息图和虚拟试穿等场景。
阿里千问开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅 7B 参数,原生支持透明图像的生成与编辑。更新亮点包括轻量结构与推理优化、支持最多 10 张参考图的局部编辑与人像商品保真,以及文字排版和人物光影表现提升,模型已上架 GitHub、HuggingFace 和 ModelScope。
🔗
Terence Tao:
我最大的猜测是,对于规模化RL,大多数中国顶级AI实验室开始大量使用华为做推理、Nvidia做训练(可能不用于特殊架构)。随着智能体集群、更大规模后训练等成为常态,这将加速他们的国内产业。
Gemini 在夺旗演练中因环境配置失误意外访问三家真实企业系统,本文借此梳理 AI 安全的三类风险,并系统介绍 AWS 在 AI for Security 与 Security for AI 两条路径上的产品与真实案例。
腾讯混元联合清华、北大提出 WebCraftBench,把软件测试方法引入 AI 网页生成评测,通过插桩、覆盖率引导探索与多维评分,在 197 组人类偏好对比中达到 85.3% 一致率。
一篇评论文章认为,LLM 正在无视版权与许可证吞食网络内容,打破软件版权与开放之间维持了 40 年的平衡。作者称 AI 让分享知识从对世界的馈赠变成作者的负担:公开代码可能被 AI 更易发现漏洞、被 AI 生成的 pull request 淹没,而现有许可证义务缺乏执法意愿。他警告这可能导致数字黑暗时代,呼吁创作者联合推动新的数字复兴。
FutureBit 本周上线概念验证项目 HashFly,用模拟果蝇感光神经元读取比特币区块头并执行双重 SHA-256 哈希运算,网页端算力约 100 千哈希每秒。
Vercel AI Gateway 上开源模型 token 占比今日或创纪录,达 78.4%,闭源模型为 21.6%。Moonshot AI 与 DeepSeek 分列支出第 3、4 位,加上 Z.ai 后合计支出超过 OpenAI(第 2)
那个漂移看起来很真实。没人需要坐到方向盘后面。
针对 The Information 报道的 OpenAI 接近解决千禧年大奖难题的传闻,数学研究者 Elliot Glazer 表示怀疑,认为相关进展更可能是 Hodge 猜想针对阿贝尔簇的特殊案例,而非完整解决
百度在超级智能体大会深圳站发布百度搭子开发平台与生态开放平台,并升级百度搭子企业版,新增企业版移动端及多人协作能力。官方称百度搭子用户规模环比增长9倍、交付物环比增长4.3倍、专家套件使用量环比增长7.3倍。开发平台通过Agent API开放智能体配置、工具与技能配置及运行能力,支持公有云、VPC专属部署和本地私有化。
FBI 局长卡什·帕特尔在福克斯新闻访谈中称,经他推动 FBI 的 AI 使用量增长 605%,并在跟进线索、阻止北卡罗来纳州等七个州的枪击事件中发挥作用。
The Verge 采访多位网络安全专家后报道称,相比失控 AI 智能体,恶意人类使用生成式 AI 攻击能源基础设施仍是更大风险。专家指出美国核反应堆平均年龄约 44 年,老旧 OT 系统补丁困难,LLM 让缺乏 OT 知识的攻击者更容易得手。OpenAI 近期曾承诺 10 亿美元补贴关键基础设施防御模型,但专家提醒不要依赖 AI 对抗 AI。
作者宣布其项目已上线,所有人可玩,若使用 TypeSafe AI(JEV 官方 API)需自带 API。
阶跃星辰发布 Step 5 Preview,以 600B 稀疏 MoE 架构在 AA 智能指数夺得全球开源前三,并通过实测编程、长程 Agent、深度研究及金融尽调四大场景,验证其高性价比与生产级长任务执行力。
Runway 公布实时视频生成研究,用户可在描述提示词的同时流式生成视频,而非输入提示后等待成品。该方案基于其首个 General World Model GWM-1(构建于 Gen-4.5 之上,逐帧生成,支持镜头运动、机器人指令或音频控制),通过用自身输出训练模型来抑制误差累积。
农业农村部会议强调大力推进"人工智能 +"农业,拓展无人机、物联网等应用场景,并聚焦高端智能、丘陵山区适用农机等短板攻关标志性整机和关键共性技术。本月初农业农村部与工业和信息化部联合印发《全国农业机械化发展"十五五"规划》,提出到 2030 年农作物耕种收综合机械化率超过 80%,丘陵山区力争提高到 75% 以上,人工智能、新能源等新技术新装备广泛应用。
作者认为 AI 编码不会必然拉低代码质量,关键在分层管理质量,其团队在把产出提高 2-3x 的同时让 bug 保持稳定甚至减少。
据路透社独家报道,Anthropic 已在旧金山湾区建成一间湿实验室,把 AI 从软件延伸到药物研发,由生命科学负责人 Eric Kauderer-Abrams 证实。
据 Arstechnica 报道,获北约 DIANA 支持的瑞典初创公司 Scaleout Systems(斯凯奥特系统)在小型无人机上部署轻量化 AI 模型,用于目标识别与打击,无需依赖中央服务器。
华为与中国移动内蒙古公司在呼伦贝尔华能伊敏露天矿完成全国首个露天矿山场景 5G-A 千兆上行网络能力验证,依托 4.9GHz+F/A SUL 辅助上行技术,实测单用户上行峰值速率达 1022Mbps
小北分析 Vercel AI Gateway 上线近三个月的模型榜单,总结为开放模型吃掉 Token、闭源模型拿走预算。开放权重模型占 80.1% 的 Token,其中 DeepSeek V4.1 Flash 一款占 64.8%;花费榜前列是 Claude Opus、GPT-6 Astra、Kimi K3
Google Labs 推出实验性 AI 助手 CC,可连接成员授权共享的邮件、日历、聊天与任务,每天早晨把关键待办、事件与行程整理成简报发给全家。该工具面向多成员家庭与群组,让成员无需反复核对琐碎日程即可保持信息同步,目前可在 labs.google.com/cc/landing 申请。