🎨 Gemini AI 功能
智能聊天
支持多轮对话和流式响应的智能聊天助手,实时显示生成内容。
- 多轮对话支持
- 流式响应显示
- 系统指令配置
- 多种模型选择
文本生成
基于 Gemini API 的智能文本生成,支持系统指令和高级参数配置。
- 支持多种 Gemini 模型
- 系统指令配置
- 温度、Top-P、Top-K 等参数
- 思考功能(2.5 模型)
文字生成图片
根据文本提示词生成高质量图片,支持多种模型、宽高比和分辨率。
- 支持 1K、2K、4K 分辨率
- 多种宽高比选择
- 随机种子支持
GPT-image2 图片生成
基于 OpenAI 图片模型的文本生图能力,支持尺寸与质量参数调节。
- 支持自定义模型
- 支持 3 种尺寸比例
- 支持 high/medium/low 质量
图片生成图片
基于现有图片生成新图片,支持多图输入和创意合成。
- 支持多图上传
- 图片预览功能
- 拖拽上传支持
音频理解
分析和理解音频内容,支持转写、翻译、情绪检测等功能。
- 音频转写(语音转文字)
- 音频翻译
- 情绪检测和讲话人区分
语音生成(TTS)
文本转语音功能,支持单说话者、多说话者和自定义配置。
- 单说话者 TTS
- 多说话者对话生成
- 自定义风格、口音、节奏
Live API - 实时语音交互
实时语音对话功能,支持低延迟的语音输入和音频输出,提供自然的对话体验。
- 实时语音输入与输出
- 粤语/国语/英语等多语言
- 连续对话与按住说话
- WebSocket 实时连接
文本转视频
根据文本提示词生成高质量视频,支持多种模型、时长和分辨率选择。
- 支持 Veo 3.1、Veo 3.0 等模型
- 4秒、6秒、8秒时长选择
- 720p、1080p 分辨率
- 包含原生音频(Veo 3.1)
智能客服
基于 Gemini 和向量数据库的智能客服系统,支持知识库管理和多轮对话。
- 向量数据库检索
- 知识库管理
- 多轮对话支持
- 智能问答
视频扩展
扩展之前使用 Veo 生成的视频,在现有视频基础上生成更多内容。
- 基于已有视频扩展
- 支持自定义扩展提示词
- 保持视频风格一致性
- 无缝衔接扩展内容
指定帧生成
通过指定第一帧和最后一帧来生成视频,实现精确的帧间过渡效果。
- 指定首尾帧图片
- 自动生成中间过渡
- 支持自定义提示词
- 精确控制视频内容
图片指导视频生成
使用最多三张参考图片来指导生成的视频内容,实现图片到视频的转换。
- 支持 1-3 张参考图片
- 图片内容指导生成
- 8秒视频时长
- 保持图片风格特征
图生视频
使用单张图片生成视频,基于 Google Veo 3.1 模型,将静态图片转换为动态视频。
- 单张图片输入
- 支持多种图片格式
- 基于 Veo 3.1 模型
- 图片预览和拖拽上传
CrewAI 客户服务分析
使用 Gemini 2.5 Pro 和 CrewAI 进行多代理客户支持分析,生成 COO 执行报告。
- 数据分析师:识别问题和趋势
- 流程优化专家:提出改进建议
- 报告编写者:生成执行报告
- 多步骤协同分析
LangGraph ReAct 智能体
使用 Gemini 2.5 Pro 和 ReAct 模式构建的智能体,支持多种工具调用和循环推理。
- ReAct 模式:推理和执行结合
- 基础工具:天气、时间、计算、单位转换、文本统计
- MySQL 数据库:查询、更新、获取表列表和列信息
- HTTP 请求:GET/POST/PUT/DELETE
- 文件操作:读取、写入文件,列出目录
智能抠图(主体分割)
火山引擎通用图像分割,一键检测主体、去除背景,生成透明图。
- 主体分割 · 人像/商品/宠物
- 透明背景 PNG 输出
- 支持 JPG、PNG 等格式
豆包实时语音对话
火山引擎端到端实时语音大模型,支持语音与文本实时对话。
- 实时语音输入与合成回复
- 支持文本消息
- 输入/输出转写展示
🤖 OpenAI 功能
实时对话
基于 OpenAI Realtime API 的低延迟语音对话,支持实时转录与语音流式回复。
- 实时语音输入与输出
- 输入/输出实时转录
- 内置 + 自定义语音可选
- 支持文本消息
指令语音工作室
用文字指令生成语音样本,再上传注册为 OpenAI Realtime 可用的 voice_id。
- 指令生成 + 语言/语调/情绪控制
- 自动作为样本上传注册
- 获得 voice_xxx 用于实时流
- 一键跳转实时对话
自定义语音(上传)
上传授权录音与语音样本,创建 OpenAI 自定义 voice_id,并用于 Realtime 实时流。
- 授权录音 + 样本上传
- 创建 / 列表 / 删除语音
- 一键用于实时对话
- 需账号开通权限
GPT-6 Astra 图生 3D
上传一张参考图,用
gpt-6-astra 理解物体并生成可预览、可下载的 3D 模型(GLB)。
- 本地 Blender:Astra 写 bpy 建模导出 FBX
- 可选 Meshy 真实网格 / Astra 积木兜底
- 质量档位:快速 / 标准 / 高质
- Three.js 预览 · 下载 FBX
🎭 LiveAvatar 功能
🎯 MiniMax AI 功能
实时对话
Chat 多轮对话 + T2A 流式播报;支持麦克风识别或文本输入,边生成边播放。
- 语音 / 文本多轮对话
- Chat + T2A 组合链路
- PCM 低延迟边收边播
- 可选纯 TTS 朗读
混合流式语音对话
OpenAI / DeepSeek 流式对话 + MiniMax 音色播报,按句切分边生成边播放。
- OpenAI / DeepSeek 可切换
- gpt-realtime-whisper 流式转写
- 流式字幕 + 句级 TTS
- MiniMax T2A PCM 播报
文本转语音(TTS)
MiniMax 文本转语音服务,支持多种语音、语速、音调等参数调节。
- 多种语音选择
- 语速、音调、音量调节
- 语言增强支持
- 模型和情感选择
语音设计
根据描述生成自定义音色,支持语音描述和预览文本输入,生成专属语音ID。
- 自定义音色生成
- 语音描述输入
- 预览音频试听
- 语音ID管理