新闻中心
首页 > 新闻中心 > DeepSeek Harness新版本发布:14项升级带来多模态功能强劲增强

DeepSeek Harness新版本发布:14项升级带来多模态功能强劲增强

2026-08-20

昨晚,DeepSeek Harness迎来了自公测以来的首次重大更新,版本号为v0.1.0-rc.8。此次更新的核心亮点是多模态能力的显著提升,整体带来了14项重要调整,涉及多模态输入、子代理合作、终端用户体验、工具调用和开发者支持等多个方面。这一版本不仅提升了Agent处理图片等多模态任务的能力,也优化了子代理的协作、终端交互和工具调用的整体体验。

新版实现了对原生图片请求和图文混合输入的支持,指令如/goal、/plan等现已可以直接处理图片。同时,Claude Code和Codex也被进一步整合进子代理体系,Windows终端的体验以及有关图片请求、流式生成和自定义网关等多个问题也得到了有效修复。DeepSeek Harness于8月13日正式启动了v0.1版的公测并同步开源。在公测首夜,智东西团队迅速拉取源码进行实测,成功完成了88页论文翻译和贪吃蛇游戏的开发任务。在不到一周内,这一Agent Harness便实现了多模态能力的升级。此次更新迅速引发了DeepSeek Harness社区的热议,一位国内开发者在看到更新后兴奋地表示:“DSH支持多模态了,太棒了!”而海外开发者也对此表示关注,纷纷评价DeepSeek Harness在多模态和子代理集成方面的进步使其变得“越来越吸引人”。此外,有开发者深入挖掘了DeepSeek Harness的“看图”机制,发现即使面对不支持图像输入的模型,它也能通过调用OCR、颜色统计和像素扫描等工具,将图片转换为结构化信息,进而交由文本模型进行推理,实际上为纯文本模型提供了一种工具层面的视觉理解。

更新的主要内容之一是多模态输入的正式全面支持。根据官方更新日志,DeepSeek模型适配器现在能通过配置启用原生图片输入能力。对于具备视觉功能的模型,Harness现在能够直接将图片发送给模型处理。而指令/goal、/plan等也支持图文混合形式的输入。此外,输入框的@菜单中新增了文件和会话引用,用户可以直接引入本地文件或已有会话内容到当前的任务中。这意味着,过去主要围绕文本、代码和工具调用的Agent工作流,现在可以将截图和图片等视觉信息纳入任务上下文中。

子代理体系也在持续扩展。新版本支持根据需要安装Claude Code和Codex作为Profile Bundle。其中,Codex支持非交互权限模式以及多个命名实例,方便用户在同一任务中配置不同的Codex子代理。此次更新特别关注了Windows用户的体验,DeepSeek Harness的PTY终端增强了持久的PowerShell会话功能,并在极简模式下默认开启,成功减少了命令执行时频繁重建终端环境的问题。此外,这次更新还集中修复了在公测期间暴露出的多个问题,包括单张大图片或历史会话中积累的图片过多可能导致请求失败的问题,版本对这些情况进行了优化。

除了支持原生图片请求外,开发者还迅速发现了一个新亮点。在测试DeepSeek Harness处理图像时,发现当调用的模型没有声明图像输入能力时,直接调用read_image会立即失败,但执行仍然继续。通过观察执行路径,用户发现Harness会自动转向一套替代的工具链:首先进行OCR文字识别,然后统计图片中颜色比例和扫描部分像素,最后提取图片尺寸、色彩模式等元信息。比如,包含文字和简单图形的图片可以被分析为“文字内容与坐标”“背景颜色比例”“特定区域像素变化”“图片尺寸”等多组结构化信息。这些结构化结果最终会被输入到文本大模型中,让其根据OCR文本、颜色比例和像素位置等证据进行推理,从而大致复原出整张图的内容。这种能力与视觉大模型直接解析图片仍存在明显区别,对于PPT截屏、流程图等结构清晰的图片,利用OCR和像素特征可以提取有效信息,但对于复杂的实景照片,这种工具链提供的信息则受到明显限制。但从Agent Harness的角度来看,这种设计相当有趣:视觉能力并不完全依赖于基础模型,而是依托于工具的整合与运用。

西班牙战机在东欧首开火力,北约的新态度显露无遗

张维为:在中国,“人民”蕴含深厚的精神内涵

联系我们
  • 电话:13594780169
  • 邮箱:accursed@att.net
  • 地址:武夷山市反像之门96号
留言

Copyright © 球友会·(中国)官方网站 版权所有 网站地图

WeChat
WeChat

留言框-

球友会·(中国)官方网站

13594780169