ALIBABA CLOUD · MODEL STUDIO

듣고, 보고,
바로 말로 답합니다.

Qwen3.5-Omni Realtime은 실시간 오디오와 영상을 입력받아 텍스트와 자연스러운 음성을 스트리밍으로 돌려줍니다. 하나의 대화, 하나의 연결로.

  • IN오디오 · 영상 프레임
  • OUT텍스트 · 음성

01HEAR

녹음기가 아니라, 사람처럼 듣습니다.

말소리와 함께 주변 소리, 악기, 겹쳐진 대화까지 이해합니다. 시맨틱 VAD가 말이 끝나는 시점을 판단하고, 언제든 말을 끊고 다시 물어볼 수 있습니다.

  • 음성 + 환경음
  • 시맨틱 / 무음 VAD
  • 끼어들기

02SEE

화면, 카메라, 보고 있는 영상까지.

오디오와 함께 초당 1프레임의 이미지가 들어갑니다. 장면의 흐름, 화면 속 글자와 도표를 읽고, 소리와 영상이 어떻게 연결되는지 설명합니다.

  • 카메라 · 화면
  • 영상 스트림
  • 글자 · 도표 인식

03UNDERSTAND

여러 언어를 듣고, 원하는 언어로.

다국어 음성을 이해하고, 지시에 따라 원하는 언어로 번역해 말합니다. 대화의 맥락은 세션 내내 이어집니다.

  • 다국어 이해
  • 지시 기반 번역
  • 세션 맥락 유지

04SPEAK

기다림 없이, 목소리로 답합니다.

답변은 생성되는 즉시 24 kHz 음성과 자막으로 흘러나옵니다. 목소리를 고르고, 차분하게 혹은 활기차게 — 말투는 프롬프트로 연출합니다.

  • 스트리밍 음성
  • 목소리 선택
  • 말투 연출

05ACT

대화가 곧 행동이 됩니다.

함수 호출로 앱의 기능을 실행하고 결과를 이어서 말합니다. 웹 검색을 켜면 최신 정보를 찾아 답합니다.

  • 함수 호출
  • 웹 검색
  • 결과 이어 말하기

TECHNICAL SPECIFICATIONS

하나의 연결로 끝나는 실시간 멀티모달.

입력음성 · 소리 · 카메라 · 화면
qwen3.5-omni-realtimeWebSocket
출력자막 · 음성 · 함수 호출
16kHz
PCM 16-bit 모노 오디오 입력
24kHz
스트리밍 음성 출력
1fps
오디오와 함께 보내는 영상 프레임
120분
세션당 최대 연결 시간

PLUS

qwen3.5-omni-plus-realtime

이해력과 답변 품질이 가장 중요한 서비스에.

FLASH

qwen3.5-omni-flash-realtime

더 가볍고 빠른 응답이 필요한 대화형 경험에.

BUILT FOR

하나의 모델, 수많은 순간.

듣고, 보고, 말하는 능력이 하나로 합쳐지면 이런 경험을 만들 수 있습니다.

  1. 01

    영상 해설

    장면과 소리의 관계, 사건의 순서를 실시간으로 설명

  2. 02

    소리 이해

    환경음, 악기, 겹쳐진 소리를 구분하고 묘사

  3. 03

    실시간 통역

    인터뷰와 연설을 원하는 언어의 목소리로

  4. 04

    음성 비서

    말을 끊고 이어 묻는 자연스러운 대화

  5. 05

    캐릭터 · 내레이션

    목소리와 말투를 연출하는 음성 콘텐츠

  6. 06

    화면 가이드

    보이는 글자와 도표를 읽고 단계별로 안내

  7. 07

    음성 제어

    말 한마디로 앱 기능을 실행하고 결과를 보고

  8. 08

    라이브 브리핑

    웹에서 최신 정보를 찾아 말로 요약

세상을 듣고 보는 AI,
이제 말로 대답합니다.

Alibaba Cloud Model Studio에서 만나보세요.