10月9日,Cloudflare宣布发布Clef-omni,在文字和图片之外加入音频及视频输入。官方同时公布了Clef系列的性能和价格调整,本次新模型重点是根据多种输入作出结构化判断。
例如,开发者可以在同一次请求中提交设备照片、运行声音和视频,让模型按预先定义的问题与选项进行分析。官方提供了开发文档,并在Hugging Face开放模型权重。
这类决策模型与生成长篇回答的聊天助手不同。它主要面向指定字段和选项的判断任务,不能据此认定它能完成所有音视频理解,或把厂商测试成绩当成每个实际场景的保证。
对普通用户,多模态工具可能减少在不同应用之间转换素材的步骤。但上传录音、照片或视频前,仍应检查服务的数据使用范围;重要判断需要人工复核,可用功能与费用以实际服务说明为准。
来源:Cloudflare官方博客 · 原报道日期 2026-10-09。本文为云豹加速器整理的原创概述。
返回科技新闻