<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>数字人 on Huoke.Me - 跨境生活，从理财开始！</title><link>https://blog.huoke.me/tags/%E6%95%B0%E5%AD%97%E4%BA%BA/</link><description>Recent content in 数字人 on Huoke.Me - 跨境生活，从理财开始！</description><generator>Hugo</generator><language>cn</language><lastBuildDate>Mon, 10 Aug 2026 01:48:14 +0800</lastBuildDate><atom:link href="https://blog.huoke.me/tags/%E6%95%B0%E5%AD%97%E4%BA%BA/index.xml" rel="self" type="application/rss+xml"/><item><title>数字人口播自动化实操</title><link>https://blog.huoke.me/posts/digital-human/</link><pubDate>Mon, 10 Aug 2026 01:48:14 +0800</pubDate><guid>https://blog.huoke.me/posts/digital-human/</guid><description>&lt;blockquote>
&lt;p>🎯 一句话总结：把声音与画面拆开，MiniMax 负责克隆声音和生成配音，HeyGen 负责驱动人像，Codex 负责检查素材、控制生成顺序并记录任务状态。整条流程最重要的一步，是先做 15 秒样片，确认后再生成完整版。&lt;/p>&lt;/blockquote>
&lt;hr>
&lt;h2 id="-整条链路怎么分工">📌 整条链路怎么分工&lt;/h2>
&lt;p>&lt;img src="https://blog.huoke.me/img/posts/digital-human/hero.webp" alt="数字人口播自动化流程" title="MiniMax、HeyGen 与 Codex 数字人口播自动化流程" loading="lazy" decoding="async" />
&lt;/p>
&lt;p>这套流程适合知识口播、课程讲解、产品介绍、多语言内容、短视频批量生产，以及需要长期维护固定形象的数字人账号。&lt;/p>
&lt;p>核心思路不是让一个平台包办所有环节，而是把声音和画面分开处理：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>环节&lt;/th>
 &lt;th>工具&lt;/th>
 &lt;th>负责内容&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>声音&lt;/td>
 &lt;td>MiniMax&lt;/td>
 &lt;td>声音克隆、TTS 配音、输出 MP3&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>画面&lt;/td>
 &lt;td>HeyGen&lt;/td>
 &lt;td>人像驱动、口型、表情、动作与视频生成&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>流程&lt;/td>
 &lt;td>Codex&lt;/td>
 &lt;td>素材检查、API 调用、样片确认、状态记录与风险控制&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>完整链路如下：&lt;/p>
&lt;ol>
&lt;li>检查文案、人像和声音样本。&lt;/li>
&lt;li>用 MiniMax 克隆声音并生成完整配音。&lt;/li>
&lt;li>截取配音前 15 秒，交给 HeyGen 生成竖屏样片。&lt;/li>
&lt;li>人工检查声音、口型、脸部稳定性和构图。&lt;/li>
&lt;li>样片确认后，再生成完整视频。&lt;/li>
&lt;li>下载成片并检查音画、时长和文件完整性。&lt;/li>
&lt;li>把 &lt;code>voice_id&lt;/code>、&lt;code>asset_id&lt;/code>、&lt;code>video_id&lt;/code> 和任务状态写入状态文件。&lt;/li>
&lt;/ol>
&lt;blockquote>
&lt;p>⚠️ MiniMax 已经生成配音后，应把这段音频直接上传给 HeyGen 驱动画面。不要再切回 HeyGen 的 &lt;code>script + voice_id&lt;/code> 配音方式，否则最终声音可能不再是原来的克隆音色。&lt;/p>&lt;/blockquote>
&lt;hr>
&lt;h2 id="-minimax-声音克隆怎么准备">🎙️ MiniMax 声音克隆怎么准备&lt;/h2>
&lt;p>声音克隆质量不好，很多时候不是模型的问题，而是样本里混入了背景音乐、混响、电流声或多人对话。&lt;/p>
&lt;p>MiniMax 当前支持的克隆样本要求如下：&lt;/p>
&lt;table>
 &lt;thead>
 &lt;tr>
 &lt;th>项目&lt;/th>
 &lt;th>要求&lt;/th>
 &lt;/tr>
 &lt;/thead>
 &lt;tbody>
 &lt;tr>
 &lt;td>文件格式&lt;/td>
 &lt;td>MP3、M4A、WAV&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>样本时长&lt;/td>
 &lt;td>10 秒至 5 分钟&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>文件大小&lt;/td>
 &lt;td>不超过 20 MB&lt;/td>
 &lt;/tr>
 &lt;tr>
 &lt;td>可选提示音频&lt;/td>
 &lt;td>少于 8 秒，并提供完全对应的文字&lt;/td>
 &lt;/tr>
 &lt;/tbody>
&lt;/table>
&lt;p>虽然 10 秒即可提交，实际录制建议控制在 30 至 90 秒：&lt;/p></description></item></channel></rss>