距离国庆节还有
:
:
:
设为首页收藏本站2026世界杯帖子赛季 简体 繁体 英语 日本 韩语 防骗检测 劰载中...

 找回密码
 立即注册

微信扫一扫,快捷登录!

只需一步,快速开始

手机扫码登录更安全

搜索
热搜: 活动 交友

今日头条

查看: 0|回复: 0

微软最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 发布:未蒸馏第三方产品,已落地

[复制链接]
荣誉元老
等级 5
折扣10%
免广告
31
累计签到
11
抢沙发
0
被点赞
  • 0
  • 1
  • 收到
  • 送出
时空年龄
0.5岁
Reserved
发表于 2 小时前 | 显示全部楼层 |阅读模式 来自 Reserved
一身戎装走天涯
一身戎装走天涯
Reserved

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区

您需要 登录 才可以下载或查看,没有账号?立即注册

×
AI 总结
• 微软当地时间7月23日宣布推出两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash,均进入公开预览阶段,并强调不依赖第三方模型蒸馏。
• MAI-Image-2.5-Pro是微软目前精度最高的图像模型,支持文字生成与自然语言编辑,已落地Bing Image Creator、PowerPoint和OneDrive等场景,并称与GPT-Image-2相比可降低最高84%的GPU成本。
• MAI-Voice-2-Flash针对高频语音优化,速度提升约2倍、成本降低32%,已接入Dynamics 365 Contact Center及Azure Voice Live服务,应用于T-Mobile、EasyJet等客户场景。
• 微软还提及MAI-Transcribe-1.5已用于医疗语音方案Dragon Copilot,支持58种语言,上季度处理2800万次患者问诊记录,语音转录错误率下降50%。
• 微软表示MAI系列模型将继续扩展,下一代GB200计算集群已投入运行,并继续推进后续模型研发。

标题:微软最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 发布:未蒸馏第三方产品,已落地 Bing 及 PowerPoint 等场景

IT之家 7 月 24 日消息,微软当地时间 7 月 23 日宣布推出两款新的自研 AI 模型,分别为 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash,目前均已进入公开预览阶段。

两款模型属于微软 AI 团队自研模型系列,分别面向高质量图像生成与高并发语音交互场景。


                               
登录/注册后可看大图

【自研背景与数据训练】
微软表示,过去一年,公司开始开发基于内部训练流程的专用模型,目标是使用经过清理、可追踪、企业级的数据进行训练,不依赖第三方模型蒸馏,并从底层设计以服务微软产品用户。

【MAI-Image-2.5-Pro 图像模型】
MAI-Image-2.5-Pro 是微软目前精度最高的图像模型,主要面向对图像质量要求较高的应用场景,包括主视觉图片生成、细节编辑以及图像内文字渲染等功能。


                               
登录/注册后可看大图


微软称,该模型在图像中文字生成准确性方面进行了优化,并支持自然语言编辑指令,用户可以通过文字描述调整生成内容。


                               
登录/注册后可看大图


该模型公开预览价格为:文本输入每 100 万个 Token 收费 5 美元(现汇率约合 33.9 元人民币),图像输入每 100 万个 Token 收费 8 美元(现汇率约合 54.3 元人民币),图像输出每 100 万个 Token 收费 106 美元(IT之家注:现汇率约合 718.8 元人民币)。


                               
登录/注册后可看大图

【MAI-Voice-2-Flash 语音模型】
另一款模型 MAI-Voice-2-Flash 则针对高频语音应用进行了优化。

微软表示,该模型相比 MAI-Voice-2 速度提升约 2 倍,同时成本降低 32%,能够在保持自然语调和较高语音质量的情况下,为大规模语音服务提供更低延迟支持。


                               
登录/注册后可看大图


MAI-Voice-2-Flash 的公开预览价格为每 100 万个字符 15 美元(现汇率约合 101.7 元人民币)。微软表示,该模型适用于客服中心、语音助手等需要快速响应的场景。


                               
登录/注册后可看大图

【产品落地与应用】
微软透露,目前两款模型已经逐步应用于旗下多个产品。

其中,Bing Image Creator 已全面采用微软自研图像模型,MAI-Image-2.5 成为其默认图像生成模型,为用户提供图像生成和编辑能力。

在 PowerPoint 中,MAI-Image-2.5 已用于图像到图像编辑功能。微软称,与 GPT-Image-2 相比,该模型可降低最高 84% 的 GPU 成本。

在 OneDrive 中,MAI-Image-2.5 已成为部分图像编辑功能的默认模型。微软数据显示,部署后相关场景保存成功率提升 26%,P95 延迟降低约 25%,在中等负载生产环境中的效率提升 2.5 倍。

语音方面,MAI-Voice-2-Flash 已接入 Dynamics 365 Contact Center,用于企业客服智能体服务。

微软表示,该模型可降低最高 89% 的 GPU 成本,并已应用于包括 T-Mobile、EasyJet 等客户的相关场景。

此外,微软还将 MAI-Voice-2-Flash 集成至 Azure Voice Live 服务,开发者可以利用该模型构建支持语音到语音交互的智能体。

【专业领域合作与扩展】
微软还表示,其自研模型正在与专业领域合作伙伴结合。

例如,MAI-Transcribe-1.5 已应用于医疗语音解决方案 Dragon Copilot,该服务目前被 17 万名医疗服务提供者使用,上季度处理了 2800 万次患者问诊记录。

微软称,MAI-Transcribe-1.5 支持 58 种语言,在内部多语言录音测试中,大多数语言的语音转录错误率和语言识别错误率均实现 50% 的相对下降,早期研究显示,其生成医疗记录的准确性也有所提升。

微软表示,MAI 系列模型将继续扩展,并通过 Foundry 平台提供给开发者使用。公司同时透露,微软 AI 团队下一代 GB200 计算集群目前已经投入运行,并将继续推进后续模型研发。

[来源链接] https://www.ithome.com/0/980/899.htm
一身戎装走天涯
一身戎装走天涯
情绪雷达
载入中
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

 
 
AI客服
一身戎装走天涯
105308909
工作时间:
8:00-18:00
官方微信扫一扫
简体中文
繁體中文
English(英语)
日本語(日语)
Deutsch(德语)
Русский язык(俄语)
بالعربية(阿拉伯语)
Türkçe(土耳其语)
Português(葡萄牙语)
ภาษาไทย(泰国语)
한어(朝鲜语/韩语)
Français(法语)
军人岁月志
这里是属于军人的专属回忆长廊,是铭刻热血青春的精神阵地。无论你是身着戎装的现役战友,还是卸下肩章的退伍老兵,都能在此提笔记录军营里的难忘瞬间——是新兵连的摸爬滚打、训练场上的汗流浃背,是执行任务时的并肩作战,也是离别军营时的不舍泪光。分享你的军旅故事,晒出珍藏的老照片,聊聊那些年一起吃苦的兄弟情。让每一段兵旅岁月都有迹可循,让每一份迷彩情怀都能共鸣回响。
×

Archiver|手机版|小黑屋|一身戎装走天涯 ( 晋ICP备2026001322号-1|晋公网安备14088202000143号 ) 简体 繁体 英语 日本 韩语

GMT+8, 2026-7-24 10:31 , Processed in 3.174327 second(s), 109 queries .

Powered by YsrzztY X3.5 Licensed

© 2025-2026 本站支持 IPv6 网络 .

快速回复 返回顶部 返回列表