Kosmos-1 可以分析图像的内容、解决视觉难题、执行视觉文本识别、通过视觉智商测试以及理解自然语言指令等等。
从报道中获悉,Kosmos-1 可以处理文本、音频、图像和视频等内容,构建一个全能型的人工智能,可以像人类思维一样来处理任务。
研究人员在他们的学术论文中写道:“作为智能的基本组成部分,多模态感知是实现人工智能的必要条件”。Kosmos-1 论文中的视觉示例显示模型分析图像并回答有关图像的问题,从图像中读取文本。为图像编写标题,并以 22-26% 的准确度进行视觉智商测试。
微软表示,它计划向开发人员提供 Kosmos-1,尽管该论文引用的 GitHub 页面在本文发表时没有明显的 Kosmos 特定代码。
微软新闻推荐
win10系统推荐
系统教程推荐