0

I cannot do vocals anymore

@wendyluvscatzposted Sat, 26 Sep 2026 10:17:13 GMT·0 replies

What happened?

cannot do vocals anymore
used to be able to before a Pinokio update
tried different builds of Ace_step to no avail
I am not a coder, just a dumb user

Steps to reproduce

  1. try typing vocals instead of leaving blank

Your system (OS / GPU / RAM / VRAM / etc.)
Win10/ RTX2080Ti/ 32GB RAM/ 11GB VRAM

Logs / full error output

Microsoft Windows [Version 10.0.19045.6466]
(c) Microsoft Corporation. All rights reserved.

C:\pinokio\api\ace-step-ui.pinokio.git\app\server>conda_hook & conda deactivate & conda deactivate & conda deactivate & conda activate base && npm start

> ace-step-ui-server@1.0.0 start
> node dist/index.js

Running SQLite database migrations...
Migrations completed successfully!
ACE-Step UI Server running on http://localhost:3001
Environment: production
ACE-Step API: http://127.0.0.1:42003
LAN access: http://192.168.1.161:3001
Initializing local storage provider
Job job_1790417277332_ozthxv0: Queued at position 1
[Gradio] Connected to http://127.0.0.1:42003
Job job_1790417277332_ozthxv0: Using Gradio /generation_wrapper { prompt: 'pop music', duration: undefined, batchSize: 1 }
Traceback (most recent call last):
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\queueing.py", line 766, in process_events     
    response = await route_utils.call_process_api(
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\route_utils.py", line 355, in call_process_api
    output = await app.get_blocks().process_api(
             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\blocks.py", line 2143, in process_api
    inputs = await self.preprocess_data(
             ^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\blocks.py", line 1790, in preprocess_data
    processed_value = block.preprocess(inputs_cached)
                      ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\components\dropdown.py", line 211, in preprocess
    raise Error(
gradio.exceptions.Error: "Value:  is not in the list of choices: ['euler', 'heun']"
Job job_1790417277332_ozthxv0: Gradio generation failed, trying Python spawn fallback {
  type: 'status',
  endpoint: '/generation_wrapper',
  fn_index: 127,
  time: 2026-09-26T10:07:57.839Z,
  original_msg: undefined,
  queue: true,
  title: 'Error',
  message: "Value:  is not in the list of choices: ['euler', 'heun']",
  visible: true,
  duration: 10,
  stage: 'error',
  code: undefined,
  success: false
}
Job job_1790417277332_ozthxv0: Using Python spawn (Gradio not available) {
  prompt: 'pop music',
  lyricsPreview: 'I write some lyrics\nhere to sing on high\nbut if I ',  
  duration: undefined,
  batchSize: 1
}
[ACE-Step] Skipping import of cpp extensions due to incompatible torch version 2.7.1+cu128 for torchao version 0.15.0             Please see https://github.com/pytorch/ao/issues/2919 for more info
[ACE-Step] W0926 19:38:10.323000 13324 env\Lib\site-packages\torch\distributed\elastic\multiprocessing\redirects.py:29] NOTE: Redirects are currently not supported in Windows or MacOs.
[ACE-Step] 2026-09-26 19:38:13.543 | WARNING  | acestep.training.trainer:<module>:40 - bitsandbytes not installed. Using standard AdamW.
[ACE-Step] 2026-09-26 19:38:13.593 | INFO     | acestep.gpu_config:get_gpu_memory_gb:578 - CUDA GPU detected: NVIDIA GeForce RTX 2080 Ti (11.0 GB)
[ACE-Step] 2026-09-26 19:38:13.593 | INFO     | acestep.core.generation.handler.init_service_orchestrator:initialize_service:96 - [initialize_service] Pre-Ampere CUDA detected: using float16 instead of bfloat16.
[ACE-Step] 2026-09-26 19:38:13.744 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:151 - [initialize_service] Pre-Ampere CUDA detected: using eager attention for float16 numerical stability.
[ACE-Step] 2026-09-26 19:38:13.744 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:174 - [initialize_service] Attempting to load model with attention implementation: eager
[ACE-Step] 2026-09-26 19:38:43.608 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:200 - [initialize_service] Keeping main model on cuda (persistent)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:38:56.402 | INFO     | acestep.inference:generate_music:662 - [generate_music] LLM usage decision: thinking=False, use_cot_caption=True, use_cot_language=True, use_cot_metas=True, need_lm_for_cot=True, llm_initialized=False, us
e_lm=False
[ACE-Step] 2026-09-26 19:38:56.402 | INFO     | acestep.core.generation.handler.generate_music:generate_music:313 - [generate_music] Turbo model detected: overriding guidance_scale 9.0 -> 1.0 (turbo does not use CFG).
[ACE-Step] 2026-09-26 19:38:56.402 | INFO     | acestep.core.generation.handler.generate_music:generate_music:329 - [generate_music] Starting generation...
[ACE-Step] 2026-09-26 19:38:56.402 | INFO     | acestep.core.generation.handler.generate_music:generate_music:332 - [generate_music] Preparing inputs...
[ACE-Step] 2026-09-26 19:38:57.319 | DEBUG    | acestep.core.generation.handler.generate_music:_vram_preflight_check:133 - [generate_music] VRAM pre-flight: skipping check (offload_to_cpu=True, models loaded one-at-a-time)
[ACE-Step] 2026-09-26 19:38:57.336 | WARNING  | acestep.core.generation.handler.service_generate_request:_normalize_service_generate_inputs:53 - [service_generate] dmd_gan version: infer_steps 12 exceeds maximum 8, clamping to 8
[ACE-Step] 2026-09-26 19:38:57.370 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading vae to cuda (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:38:57.970 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded vae to cuda in 0.4163s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:38:58.037 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading vae to CPU (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:38:58.654 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded vae to CPU in 0.4342s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:119 - 
[ACE-Step] ======================================================================
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:120 - \U0001f50d [DEBUG] DiT TEXT ENCODER INPUT (Inference)
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:121 - ======================================================================
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:122 - text_prompt:
[ACE-Step] # Instruction
[ACE-Step] Fill the audio semantic mask based on the given conditions:
[ACE-Step] # Caption
[ACE-Step] pop music
[ACE-Step] # Metas
[ACE-Step] - bpm: N/A
[ACE-Step] - timesignature: N/A
[ACE-Step] - keyscale: N/A
[ACE-Step] - duration: 60 seconds
[ACE-Step] <|endoftext|>
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:123 - ======================================================================
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:124 - lyrics_text:
[ACE-Step] # Languages
[ACE-Step] en
[ACE-Step] # Lyric
[ACE-Step] I write some lyrics
[ACE-Step] here to sing on high
[ACE-Step] but if I create a song
[ACE-Step] it fails and I cry<|endoftext|>
[ACE-Step] 2026-09-26 19:38:58.705 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:125 - ======================================================================
[ACE-Step] 2026-09-26 19:38:58.739 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading vae to cuda (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:38:59.205 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded vae to cuda in 0.2493s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:38:59.238 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading vae to CPU (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:38:59.839 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded vae to CPU in 0.4002s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:38:59.839 | INFO     | acestep.core.generation.handler.conditioning_embed:preprocess_batch:110 - [preprocess_batch] Inferring prompt embeddings...
[ACE-Step] 2026-09-26 19:38:59.839 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading text_encoder to cuda (RSS: 0 MB)
[ACE-Step] 2026-09-26 19:39:00.773 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded text_encoder to cuda in 0.7507s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:39:01.540 | INFO     | acestep.core.generation.handler.conditioning_embed:preprocess_batch:113 - [preprocess_batch] Inferring lyric embeddings...
[ACE-Step] 2026-09-26 19:39:01.540 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading text_encoder to CPU (RSS: 0 MB)
[ACE-Step] 2026-09-26 19:39:02.642 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded text_encoder to CPU in 0.8846s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:39:02.642 | INFO     | acestep.core.generation.handler.service_generate_execute:_execute_service_generate_diffusion:173 - [service_generate] Generating audio... (DiT backend: PyTorch (cuda))
[ACE-Step] 2026-09-26 19:39:03.109 | INFO     | acestep.core.generation.handler.service_generate_execute:_execute_service_generate_diffusion:276 - [service_generate] DiT diffusion via PyTorch (cuda)...
[ACE-Step] 2026-09-26 19:39:03.242 | INFO     | acestep.models.common.dcw_correction:__init__:98 - [DCW] Active � mode=double, scaler=0.0500, high_scaler=0.0200, wavelet='haar'
[ACE-Step] 2026-09-26 19:39:04.078 | INFO     | acestep.models.common.dcw_loader:get:84 - [DCW] Built DWT1D for wavelet='haar' (low-pass filter taps=2, device=cuda:0, dtype=torch.float16).
[ACE-Step] 2026-09-26 19:39:05.027 | INFO     | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:42 - [generate_music] Model generation completed. Decoding latents...
[ACE-Step] 2026-09-26 19:39:05.045 | DEBUG    | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:64 - [generate_music] pred_latents: torch.Size([1, 1500, 64]), dtype=torch.float16
[ACE-Step] 2026-09-26 19:39:05.045 | DEBUG    | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:65 - [generate_music] time_costs: {'encoder_time_cost': 0.08100390434265137, 'diffusion_time_cost': 1.81863832473
75488, 'diffusion_per_step_time_cost': 0.2273297905921936, 'total_time_cost': 1.8996422290802002, 'offload_time_cost': 3.1352784633636475}
[ACE-Step] 2026-09-26 19:39:05.068 | ERROR    | acestep.core.generation.handler.generate_music:generate_music:522 - [generate_music] Generation failed
[ACE-Step] Traceback (most recent call last):
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 291, in <module>
[ACE-Step]     main()
[ACE-Step]     -> <function main at 0x000001B83BF5A020>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 228, in main
[ACE-Step]     result = generate(
[ACE-Step]              -> <function generate at 0x000001B83BF43240>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 155, in generate
[ACE-Step]     result = generate_music(handler, llm_handler, params, config, save_dir=output_dir)
[ACE-Step]              |              |        |            |       |                -> 'C:\\pinokio\\api\\ace-step-ui.pinokio.git\\app\\ACE-Step-1.5\\output\\job_1790417277332_ozthxv0'
[ACE-Step]              |              |        |            |       -> GenerationConfig(batch_size=1, allow_lm_batch=False, use_random_seed=True, seeds=None, lm_batch_chunk_size=8, constrained_dec...
[ACE-Step]              |              |        |            -> GenerationParams(task_type='text2music', instruction='Fill the audio semantic mask based on the given conditions:', reference...
[ACE-Step]              |              |        -> <acestep.llm_inference.LLMHandler object at 0x000001B83BF76850>
[ACE-Step]              |              -> <acestep.handler.AceStepHandler object at 0x000001B83B36D090>
[ACE-Step]              -> <function generate_music at 0x000001B83BF59760>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\inference.py", line 916, in generate_music
[ACE-Step]     result = dit_handler.generate_music(**filtered_generate_kwargs)
[ACE-Step]              |           |                -> {'captions': 'pop music', 'global_caption': '', 'lyrics': 'I write some lyrics\nhere to sing on high\nbut if I create a song\...
[ACE-Step]              |           -> <function GenerateMusicMixin.generate_music at 0x000001B820F505E0>
[ACE-Step]              -> <acestep.handler.AceStepHandler object at 0x000001B83B36D090>
[ACE-Step] > File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\core\generation\handler\generate_music.py", line 465, in generate_music
[ACE-Step]     pred_latents, time_costs = self._prepare_generate_music_decode_state(
[ACE-Step]                                |    -> <function GenerateMusicDecodeMixin._prepare_generate_music_decode_state at 0x000001B820F50860>
[ACE-Step]                                -> <acestep.handler.AceStepHandler object at 0x000001B83B36D090>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\core\generation\handler\generate_music_decode.py", line 81, in _prepare_generate_music_decode_state
[ACE-Step]     raise RuntimeError("\n".join(hints))
[ACE-Step]                                  -> ['Generation produced NaN or Inf latents (shape=[1, 1500, 64], dtype=torch.float16, device=cuda:0, nan=96000, inf=0).', 'Comm...
[ACE-Step] RuntimeError: Generation produced NaN or Inf latents (shape=[1, 1500, 64], dtype=torch.float16, device=cuda:0, nan=96000, inf=0).
[ACE-Step] Common causes and fixes:
[ACE-Step]   1. LoRA/adapter trained on an older model version � retrain or update the adapter.
[ACE-Step]   2. Checkpoint/config mismatch � verify model checkpoints match this release.
[ACE-Step]   3. Unsupported quantization/backend � try running with --backend pt.
[ACE-Step]   4. CPU offload left parameters on wrong device � restart and regenerate.
[ACE-Step]   5. Float16 overflow on pre-Ampere GPU � set ACESTEP_DTYPE=float32.
Job job_1790417277332_ozthxv0: Generation failed Error: No audio files generated
    at processGenerationViaPython (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:542:19)
    at process.processTicksAndRejections (node:internal/process/task_queues:104:5)
    at async processGeneration (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:341:5)
    at async processQueue (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:282:17)
Job job_1790417414116_xtsjie7: Queued at position 1
Job job_1790417414116_xtsjie7: Using Gradio /generation_wrapper { prompt: 'pop music', duration: undefined, batchSize: 1 }
Traceback (most recent call last):
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\queueing.py", line 766, in process_events
    response = await route_utils.call_process_api(
               ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\route_utils.py", line 355, in call_process_api
    output = await app.get_blocks().process_api(
             ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\blocks.py", line 2143, in process_api
    inputs = await self.preprocess_data(
             ^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\blocks.py", line 1790, in preprocess_data
    processed_value = block.preprocess(inputs_cached)
                      ^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
  File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\env\Lib\site-packages\gradio\components\dropdown.py", line 211, in preprocess
    raise Error(
Job job_1790417414116_xtsjie7: Gradio generation failed, trying Python spawn fallback {
  type: 'status',
  endpoint: '/generation_wrapper',
  fn_index: 127,
  time: 2026-09-26T10:10:14.272Z,
  original_msg: undefined,
  queue: true,
  title: 'Error',
  message: "Value:  is not in the list of choices: ['euler', 'heun']",
  visible: true,
  duration: 10,
  stage: 'error',
  code: undefined,
  success: false
}
Job job_1790417414116_xtsjie7: Using Python spawn (Gradio not available) {
  prompt: 'pop music',
  lyricsPreview: 'I write some lyrics\nhere to sing on high\nbut if I ',
  duration: undefined,
  batchSize: 1
}

[ACE-Step] Skipping import of cpp extensions due to incompatible torch version 2.7.1+cu128 for torchao version 0.15.0             Please see https://github.com/pytorch/ao/issues/2919 for more info
[ACE-Step] W0926 19:40:26.778000 4288 env\Lib\site-packages\torch\distributed\elastic\multiprocessing\redirects.py:29] NOTE: Redirects are currently not supported in Windows or MacOs.
[ACE-Step] 2026-09-26 19:40:30.081 | WARNING  | acestep.training.trainer:<module>:40 - bitsandbytes not installed. Using standard AdamW.
[ACE-Step] 2026-09-26 19:40:30.148 | INFO     | acestep.gpu_config:get_gpu_memory_gb:578 - CUDA GPU detected: NVIDIA GeForce RTX 2080 Ti (11.0 GB)
[ACE-Step] 2026-09-26 19:40:30.148 | INFO     | acestep.core.generation.handler.init_service_orchestrator:initialize_service:96 - [initialize_service] Pre-Ampere CUDA detected: using float16 instead of bfloat16.
[ACE-Step] 2026-09-26 19:40:30.298 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:151 - [initialize_service] Pre-Ampere CUDA detected: using eager attention for float16 numerical stability.
[ACE-Step] 2026-09-26 19:40:30.298 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:174 - [initialize_service] Attempting to load model with attention implementation: eager
[ACE-Step] 2026-09-26 19:40:54.489 | INFO     | acestep.core.generation.handler.init_service_loader:_load_main_model_from_checkpoint:200 - [initialize_service] Keeping main model on cuda (persistent)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:41:06.081 | INFO     | acestep.inference:generate_music:662 - [generate_music] LLM usage decision: thinking=False, use_cot_caption=True, use_cot_language=True, use_cot_metas=True, need_lm_for_cot=True, llm_initialized=False, us
e_lm=False
[ACE-Step] 2026-09-26 19:41:06.081 | INFO     | acestep.core.generation.handler.generate_music:generate_music:313 - [generate_music] Turbo model detected: overriding guidance_scale 9.0 -> 1.0 (turbo does not use CFG).
[ACE-Step] 2026-09-26 19:41:06.081 | INFO     | acestep.core.generation.handler.generate_music:generate_music:329 - [generate_music] Starting generation...
[ACE-Step] 2026-09-26 19:41:06.081 | INFO     | acestep.core.generation.handler.generate_music:generate_music:332 - [generate_music] Preparing inputs...
[ACE-Step] 2026-09-26 19:41:06.314 | DEBUG    | acestep.core.generation.handler.generate_music:_vram_preflight_check:133 - [generate_music] VRAM pre-flight: skipping check (offload_to_cpu=True, models loaded one-at-a-time)
[ACE-Step] 2026-09-26 19:41:06.314 | WARNING  | acestep.core.generation.handler.service_generate_request:_normalize_service_generate_inputs:53 - [service_generate] dmd_gan version: infer_steps 12 exceeds maximum 8, clamping to 8
[ACE-Step] 2026-09-26 19:41:06.366 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading vae to cuda (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:41:06.932 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded vae to cuda in 0.3656s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:07.016 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading vae to CPU (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:41:07.683 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded vae to CPU in 0.4702s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:07.717 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:119 - 
[ACE-Step] ======================================================================
[ACE-Step] 2026-09-26 19:41:07.717 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:120 - \U0001f50d [DEBUG] DiT TEXT ENCODER INPUT (Inference)
[ACE-Step] 2026-09-26 19:41:07.735 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:121 - ======================================================================
[ACE-Step] 2026-09-26 19:41:07.735 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:122 - text_prompt:
[ACE-Step] # Instruction
[ACE-Step] Fill the audio semantic mask based on the given conditions:
[ACE-Step] # Caption
[ACE-Step] pop music
[ACE-Step] # Metas
[ACE-Step] - bpm: N/A
[ACE-Step] - timesignature: N/A
[ACE-Step] - keyscale: N/A
[ACE-Step] - duration: 60 seconds
[ACE-Step] <|endoftext|>
[ACE-Step] 2026-09-26 19:41:07.735 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:123 - ======================================================================
[ACE-Step] 2026-09-26 19:41:07.735 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:124 - lyrics_text:
[ACE-Step] # Languages
[ACE-Step] en
[ACE-Step] # Lyric
[ACE-Step] I write some lyrics
[ACE-Step] here to sing on high
[ACE-Step] but if I create a song
[ACE-Step] it fails and I cry<|endoftext|>
[ACE-Step] 2026-09-26 19:41:07.735 | INFO     | acestep.core.generation.handler.conditioning_text:_prepare_text_conditioning_inputs:125 - ======================================================================
[ACE-Step] 2026-09-26 19:41:07.750 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading vae to cuda (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:41:08.250 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded vae to cuda in 0.3168s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:08.284 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading vae to CPU (RSS: 0 MB)
[ACE-Step] There are modules in AutoencoderOobleck that should be kept in float32: []. Casting directly with `to()` can lead to inconsistent results; set `torch_dtype` in `from_pretrained()` instead to keep these modules in float32.
[ACE-Step] 2026-09-26 19:41:08.934 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded vae to CPU in 0.4504s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:08.934 | INFO     | acestep.core.generation.handler.conditioning_embed:preprocess_batch:110 - [preprocess_batch] Inferring prompt embeddings...
[ACE-Step] 2026-09-26 19:41:08.934 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:41 - [_load_model_context] Loading text_encoder to cuda (RSS: 0 MB)
[ACE-Step] 2026-09-26 19:41:10.068 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:58 - [_load_model_context] Loaded text_encoder to cuda in 0.9409s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:10.853 | INFO     | acestep.core.generation.handler.conditioning_embed:preprocess_batch:113 - [preprocess_batch] Inferring lyric embeddings...
[ACE-Step] 2026-09-26 19:41:10.853 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:67 - [_load_model_context] Offloading text_encoder to CPU (RSS: 0 MB)
[ACE-Step] 2026-09-26 19:41:11.871 | INFO     | acestep.core.generation.handler.init_service_offload_context:_load_model_context:83 - [_load_model_context] Offloaded text_encoder to CPU in 0.8008s (RSS: 0 -> 0 MB, delta: +0 MB)
[ACE-Step] 2026-09-26 19:41:11.871 | INFO     | acestep.core.generation.handler.service_generate_execute:_execute_service_generate_diffusion:173 - [service_generate] Generating audio... (DiT backend: PyTorch (cuda))
[ACE-Step] 2026-09-26 19:41:12.270 | INFO     | acestep.core.generation.handler.service_generate_execute:_execute_service_generate_diffusion:276 - [service_generate] DiT diffusion via PyTorch (cuda)...
[ACE-Step] 2026-09-26 19:41:12.371 | INFO     | acestep.models.common.dcw_correction:__init__:98 - [DCW] Active � mode=double, scaler=0.0500, high_scaler=0.0200, wavelet='haar'
[ACE-Step] 2026-09-26 19:41:13.155 | INFO     | acestep.models.common.dcw_loader:get:84 - [DCW] Built DWT1D for wavelet='haar' (low-pass filter taps=2, device=cuda:0, dtype=torch.float16).
[ACE-Step] 2026-09-26 19:41:14.056 | INFO     | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:42 - [generate_music] Model generation completed. Decoding latents...
[ACE-Step] 2026-09-26 19:41:14.056 | DEBUG    | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:64 - [generate_music] pred_latents: torch.Size([1, 1500, 64]), dtype=torch.float16
[ACE-Step] 2026-09-26 19:41:14.056 | DEBUG    | acestep.core.generation.handler.generate_music_decode:_prepare_generate_music_decode_state:65 - [generate_music] time_costs: {'encoder_time_cost': 0.06709599494934082, 'diffusion_time_cost': 1.71839714050
29297, 'diffusion_per_step_time_cost': 0.2147996425628662, 'total_time_cost': 1.7854931354522705, 'offload_time_cost': 3.3448116779327393}
[ACE-Step] 2026-09-26 19:41:14.073 | ERROR    | acestep.core.generation.handler.generate_music:generate_music:522 - [generate_music] Generation failed
[ACE-Step] Traceback (most recent call last):
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 291, in <module>
[ACE-Step]     main()
[ACE-Step]     -> <function main at 0x000002D800C0A020>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 228, in main
[ACE-Step]     result = generate(
[ACE-Step]              -> <function generate at 0x000002D800BFB240>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\server\scripts\simple_generate.py", line 155, in generate
[ACE-Step]     result = generate_music(handler, llm_handler, params, config, save_dir=output_dir)
[ACE-Step]              |              |        |            |       |                -> 'C:\\pinokio\\api\\ace-step-ui.pinokio.git\\app\\ACE-Step-1.5\\output\\job_1790417414116_xtsjie7'
[ACE-Step]              |              |        |            |       -> GenerationConfig(batch_size=1, allow_lm_batch=False, use_random_seed=True, seeds=None, lm_batch_chunk_size=8, constrained_dec...
[ACE-Step]              |              |        |            -> GenerationParams(task_type='text2music', instruction='Fill the audio semantic mask based on the given conditions:', reference...
[ACE-Step]              |              |        -> <acestep.llm_inference.LLMHandler object at 0x000002D800C262D0>
[ACE-Step]              |              -> <acestep.handler.AceStepHandler object at 0x000002D800184910>
[ACE-Step]              -> <function generate_music at 0x000002D800C09760>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\inference.py", line 916, in generate_music
[ACE-Step]     result = dit_handler.generate_music(**filtered_generate_kwargs)
[ACE-Step]              |           |                -> {'captions': 'pop music', 'global_caption': '', 'lyrics': 'I write some lyrics\nhere to sing on high\nbut if I create a song\...
[ACE-Step]              |           -> <function GenerateMusicMixin.generate_music at 0x000002D865C305E0>
[ACE-Step]              -> <acestep.handler.AceStepHandler object at 0x000002D800184910>
[ACE-Step] > File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\core\generation\handler\generate_music.py", line 465, in generate_music
[ACE-Step]     pred_latents, time_costs = self._prepare_generate_music_decode_state(
[ACE-Step]                                |    -> <function GenerateMusicDecodeMixin._prepare_generate_music_decode_state at 0x000002D865C30860>
[ACE-Step]                                -> <acestep.handler.AceStepHandler object at 0x000002D800184910>
[ACE-Step]   File "C:\pinokio\api\ace-step-ui.pinokio.git\app\ACE-Step-1.5\acestep\core\generation\handler\generate_music_decode.py", line 81, in _prepare_generate_music_decode_state
[ACE-Step]     raise RuntimeError("\n".join(hints))
[ACE-Step]                                  -> ['Generation produced NaN or Inf latents (shape=[1, 1500, 64], dtype=torch.float16, device=cuda:0, nan=96000, inf=0).', 'Comm...
[ACE-Step] RuntimeError: Generation produced NaN or Inf latents (shape=[1, 1500, 64], dtype=torch.float16, device=cuda:0, nan=96000, inf=0).
[ACE-Step] Common causes and fixes:
[ACE-Step]   1. LoRA/adapter trained on an older model version � retrain or update the adapter.
[ACE-Step]   2. Checkpoint/config mismatch � verify model checkpoints match this release.
[ACE-Step]   3. Unsupported quantization/backend � try running with --backend pt.
[ACE-Step]   4. CPU offload left parameters on wrong device � restart and regenerate.
[ACE-Step]   5. Float16 overflow on pre-Ampere GPU � set ACESTEP_DTYPE=float32.
Job job_1790417414116_xtsjie7: Generation failed Error: No audio files generated
    at processGenerationViaPython (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:542:19)
    at process.processTicksAndRejections (node:internal/process/task_queues:104:5)
    at async processGeneration (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:341:5)
    at async processQueue (file:///C:/pinokio/api/ace-step-ui.pinokio.git/app/server/dist/services/acestep.js:282:17)
Replies (0)
Up to 10 files, 25MB each. Images are optimized; GIFs -> MP4; videos 720p (max 120s).
I cannot do vocals anymore · Pinokio