메인 콘텐츠로 건너뛰기
ByteDance Seed Audio 1.0을 사용하여 단일 프롬프트로 음성, 음악, 음향 효과 및 다중 화자 대화를 생성합니다. 프롬프트에 음성, 감정, 분위기, 배경 음악 및 음향 효과를 설명하고, 말할 대사를 포함하세요. 선택적으로 내장된 사전 설정 음성을 선택하거나, 최대 3개의 참조 클립(프롬프트에서 @Audio1-3으로 태그 지정)에서 음성을 복제하거나, 캐릭터 이미지에서 음성을 추출할 수 있습니다. 실행당 최대 2분의 오디오를 생성합니다.

입력

매개변수 제약 조건

  • 참조 모드 종속성: reference_mode 매개변수는 필요한 다른 입력을 결정합니다.
    • “text only”: 추가 입력이 필요하지 않습니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다.
    • “audio reference”: reference_audio_1, reference_audio_2 또는 reference_audio_3 중 하나 이상이 연결되어야 합니다. 참조 클립은 순서대로 연결되어야 하며 중간에 비어 있으면 안 됩니다(예: _1, 그 다음 _2, 그 다음 _3). 각 클립은 최대 30초로 제한됩니다. 프롬프트는 @Audio1, @Audio2, @Audio3 태그를 사용하여 연결된 클립을 참조해야 합니다.
    • “image reference”: reference_image가 연결되어야 합니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다.
    • “preset voice”: preset_voice가 선택되어야 합니다. 프롬프트에 @AudioN 태그가 포함되어서는 안 됩니다(전체 프롬프트가 선택된 음성으로 읽힙니다).
  • 오디오 참조 순서: “audio reference” 모드를 사용할 때, 참조 오디오 입력은 reference_audio_1부터 시작하여 순차적으로 연결되어야 하며 중간에 비어 있으면 안 됩니다. 예를 들어, _1과 _2는 연결할 수 있지만, _2 없이 _1과 _3만 연결할 수는 없습니다.
  • 최대 오디오 태그: “audio reference” 모드에서 프롬프트는 최대 3개의 오디오 클립(@Audio1, @Audio2, @Audio3)을 참조할 수 있습니다. 가장 높은 번호의 태그는 연결된 참조 오디오 입력 수를 초과할 수 없습니다.

출력

이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): cefd5fca496b02c35022d25be3d99d3911c1304b6e3a751751b58841d5895ef7