Microsoft Copilot 中的视觉功能允许你共享桌面屏幕或移动摄像头,并询问 Copilot 你所看到的内容,并根据共享内容和工作数据提供答案。 若要开始使用它,请参阅 Microsoft Copilot 中的视觉入门。
视觉是如何工作的?
视觉功能会将你共享的内容转换为 Copilot 可以推理导出的信息,然后将其与工作数据相结合,大声回答问题。
- 在语音对话中共享视觉输入:桌面屏幕 (Windows 或 Web) 或移动摄像头。
- Copilot 将共享屏幕或相机内容转换为它可以分析的数据,包括文本、图像、图表和屏幕界面。
- Copilot 通过将其看到的内容与你的 Microsoft 365 工作数据(如文档、电子邮件和之前的讨论)相结合来做出响应。
- Copilot 实时语音回答,因此你可以在同一对话中提出后续问题。
视觉能做什么?
以下是您可以使用视觉做的一些最有用的事情:
- 分析并解释你正在查看的内容。 要求 Copilot 解释图表、表格、幻灯片或密集文本。 例如,“汇总此仪表板并突出显示任何异常情况”。
- 将反馈转化为后续步骤。 共享文档、电子邮件或聊天的页面,并询问:“我收到了哪些反馈,我接下来要执行什么?
- 获取项目状态更新。 共享跟踪器或工作项,并询问:“请快速提供此项的状态、当前所有者和下一个里程碑。”
- 获取上下文中的分步帮助。 将手机摄像头对准设备错误,然后询问:“如何实现此错误?
视力有哪些局限性?
- 目前只能通过与 Copilot 的语音聊天获得视觉。
- 每日使用量基于可用容量,计入每日语音使用量。 当你接近可用使用量时,Copilot 应用中将通知你。
- 视觉无法读取视频或动态 GIF。
- 提问时在窗口之间切换太快可能会导致 Copilot 根据错误的屏幕内容进行响应。
- 视觉无法执行操作或直接操作屏幕上的项目。
- 视力没有长期回忆。 它不会重复使用先前会话中的屏幕或相机输入。
注意
这些是启动时的功能。 随着时间的推移,持续的改进可能会解决其中一些限制。
视觉可以访问什么?
在活动会话期间,Copilot 会处理你选择共享的屏幕或相机内容以及 Microsoft 365 工作数据,以支持其答案,例如文档、电子邮件、会议和之前的讨论。
- 视觉输入由用户启动且受会话绑定,因此 Copilot 仅适用于活动会话期间共享的内容。
- 共享屏幕或相机内容被处理为一系列图像。 音频和视频数据是临时存储的,以便向 Microsoft 提供反馈,并且会在 48 小时后删除。
- 语音对话中的文本脚本的存储和管理方式与 Microsoft Copilot 应用中的文本对话相同。
- Vision 遵守 Microsoft 对数据安全和隐私的企业级承诺,并且不会推断出种族或情感等敏感的个人属性。
有关详细信息,请参阅 Microsoft Copilot 的数据、隐私和安全性。
支持哪些类型的内容?
Vision 可以理解一系列屏幕和真实世界的内容,包括:
- 文本、图像、图表、表格和仪表板。
- 桌面上的应用界面和多窗口工作流。
- 通过移动相机查看的物理对象。
支持哪些语言?
视觉功能适用于 Microsoft Copilot 支持的所有语言。 某些语言可能更容易出现发音或识别差异。 有关完整列表,请参阅 Microsoft Copilot 支持的语言。
愿景对话是如何评估的? 哪些指标用于度量性能?
为了确保质量,Copilot 给出测试问题,并根据相关性、正确性、完整性、语气和指令依从性等条件评估其响应。 为了更好地衡量性能,我们还审查了功能使用情况、竖起大拇指率、参与率和用户反馈。 我们还进行广泛的安全评估,以确保 Vision 以负责任的方式响应有害查询。
如何实现在 Copilot 中提供有关视觉的反馈?
结束语音聊天后,可以提供反馈。 您应该会在与 Microsoft 共享以改进功能的聊天历史记录中看到拇指向上/向下。 我们不会使用此反馈来训练 Copilot 使用的基础模型。