PLUS
qwen3.5-omni-plus-realtime
이해력과 답변 품질이 가장 중요한 서비스에.
ALIBABA CLOUD · MODEL STUDIO
Qwen3.5-Omni Realtime은 실시간 오디오와 영상을 입력받아 텍스트와 자연스러운 음성을 스트리밍으로 돌려줍니다. 하나의 대화, 하나의 연결로.
01HEAR
말소리와 함께 주변 소리, 악기, 겹쳐진 대화까지 이해합니다. 시맨틱 VAD가 말이 끝나는 시점을 판단하고, 언제든 말을 끊고 다시 물어볼 수 있습니다.
02SEE
오디오와 함께 초당 1프레임의 이미지가 들어갑니다. 장면의 흐름, 화면 속 글자와 도표를 읽고, 소리와 영상이 어떻게 연결되는지 설명합니다.
03UNDERSTAND
다국어 음성을 이해하고, 지시에 따라 원하는 언어로 번역해 말합니다. 대화의 맥락은 세션 내내 이어집니다.
04SPEAK
답변은 생성되는 즉시 24 kHz 음성과 자막으로 흘러나옵니다. 목소리를 고르고, 차분하게 혹은 활기차게 — 말투는 프롬프트로 연출합니다.
05ACT
함수 호출로 앱의 기능을 실행하고 결과를 이어서 말합니다. 웹 검색을 켜면 최신 정보를 찾아 답합니다.
TECHNICAL SPECIFICATIONS
PLUS
이해력과 답변 품질이 가장 중요한 서비스에.
FLASH
더 가볍고 빠른 응답이 필요한 대화형 경험에.
BUILT FOR
듣고, 보고, 말하는 능력이 하나로 합쳐지면 이런 경험을 만들 수 있습니다.
장면과 소리의 관계, 사건의 순서를 실시간으로 설명
환경음, 악기, 겹쳐진 소리를 구분하고 묘사
인터뷰와 연설을 원하는 언어의 목소리로
말을 끊고 이어 묻는 자연스러운 대화
목소리와 말투를 연출하는 음성 콘텐츠
보이는 글자와 도표를 읽고 단계별로 안내
말 한마디로 앱 기능을 실행하고 결과를 보고
웹에서 최신 정보를 찾아 말로 요약
Alibaba Cloud Model Studio에서 만나보세요.