“AI语音转文字”网站目录
-
Buzz:离线开源免费语音转文字(字幕)
基于Whisper的GUI软件:Buzz:离线语音转文字(字幕) Buzz:离线开源免费语音转文字(字幕) Whisper 是什么? Whisper 是一种通用语音识别模型。它利用各种大型数据集上的音频进行训练,也是一个多任务模型,可以执行多语言语音识别以及语音翻译和语言识别。
github.com/chidiwilliams/buzz - 收藏 -
CapsWriter-Offline 语音输入 字幕转录工具
这是 CapsWriter-Offline ,一个 PC 端的语音输入、字幕转录工具。 CapsWriter-Offline 语音输入 字幕转录工具 两个功能: 按下键盘上的 大写锁定键,录音开始,当松开 大写锁定键 时,就会识别你的录音,并将识别结果立刻输入 将音视频文件拖动到客户端打开,即可转录生成 srt 字幕 视频教程:CapsWriter-Offline 电脑端离线语音输入工具 特性 完全离线、无限时长、低延迟、高准确率、中英混输、自动阿拉伯数字、自动调整中英间隔 热词功能:可以在 hot-en.txt hot-zh.txt hot-rule.txt 中添加三种热词,客户端动态载入 日记功能:默认每次录音识别后,识别结果记录在 年份/月份/日期.md ,录音文件保存在 年份/月份/assets 关键词日记:识别结果若以关键词开头,会被记录在 年份/月份/关键词-日期.md,关键词在 keywords.txt 中定义 转录功能:将音视频文件拖动到客户端打开,即可转录生成 srt 字幕 服务端、客户端分离,可以服务多台客户端 编辑 config.py ,可以配置服务端地址、快捷键、录音开关…… 懒人包 对 Windows 端: 请确保电脑上安装了 Microsoft Visual C++ Redistributable 运行库 服务端载入模型所用的 onnxruntime 只能在 Windows 10 及以上版本的系统使用 服务端载入模型需要系统内存 4G,只能在 64 位系统上使用 额外打包了 32 位系统可用的客户端,在 Windows 7 及以上版本的系统可用 模型文件较大,单独打包,解压模型后请放入软件目录的 models 文件夹中 其它系统: 其它系统,可以下载模型、安装依赖后从 Python 源码运行。 由于我没有 Mac 电脑,无法打包 Mac 版本,只能从源码运行,可能会有诸多问题要解决。(由于系统限制,客户端需要 sudo 启动,且默认快捷键为 right shift) 模型说明: 由于模型文件太大,为了方便更新,单独打包 解压模型后请放入软件目录的 models 文件夹中 下载地址: 百度盘: https://pan.baidu.com/s/1zNHstoWZDJVynCBz2yS9vg 提取码: eu4c GitHub Release: Releases · HaujetZhao/CapsWriter-Offline (百度网盘容易掉链接,补链接太麻烦了,我不一定会补链接。GitHub Releases 界面下载是最可靠的。)
github.com/HaujetZhao/CapsWriter-Offline - 收藏 -
讯飞听见
讯飞听见依托科大讯飞的语音识别技术,打造智慧办公服务平台,提供语音转文字、录音转文字、视频会议、视频转文字、视频加字幕、同声翻译、语音翻译等服务,可满足多样化的语音转文字需求,致力于提高办公效率。
www.iflyrec.com - 收藏 -
网易见外 – AI智能语音转写听翻平台
网易见外由人工智能事业部研发,是一个集视频听翻、直播听翻、语音转写、文档直翻功能为一体的AI智能语音转写听翻平台,致力于用语音识别转写文字、机器翻译等技术为从事和爱好语音转写、翻译的人员提供更便捷的听翻工具,提升工作效率,降低转写成本,进而改变人们跨文化交流与内容跨国界传播的实现方式 。 进入网易见外官方网站—>用网易邮箱账号登陆—>点击新建项目—>语音转写—>上传音频文件—>提交。等待几分钟,字幕就生成了,直接导出就好,准确率蛮高,几乎不需要修正。
sight.youdao.com - 收藏 -
通义听悟
「通义听悟」是通义家族新成员,依托通义千问语言模型、音视频AI模型能力,为用户带来音频和视频内容记录和阅读的全新体验,成为在工作和学习中的AI助手,让每个人都能亲身去体验AI功能给我们带来的效率提升和灵感迸发。 通义听悟可以帮助用户在会议、学习、访谈、培训等场景下: 实时记录交流内容,多语言翻译 批量转写本地/阿里云盘音视频文件,自动区分发言人 智能提炼全文概要、章节速览、发言总结 自动提取关键词、问题回顾、待办事项 编辑整理笔记,导出记录 目前,包括全文概要、章节速览、发言总结等高阶AI能力在内的全部功能,用户无需申请和排队即可马上体验。同时官网还提供了丰富的权益活动,使用户能够获取更多使用时长。
tingwu.aliyun.com/home - 收藏
📰 推荐资讯
⭐ 推荐站点
-
造点
核心功能与模型 “造点”平台的最大亮点是整合了业界顶尖的AI模型,实现了“强强联合”: 1. AI生视频:率先接入 通义万相 Wan2.5 全球首发/国内首个: 成为国内首个支持音画同步生成的平台。它可以在生成视频画面的同时,自动匹配人声、音效和背景音乐。 高质量输出: 支持生成长达10秒、1080P高清、24帧/秒的视频,画质可满足专业需求。 强指令遵循: 能够理解并执行复杂的指令,如运镜、视角切换等连续变化。 声音驱动: 用户可以在提示词中用引号(“”)来描述声音,实现声音驱动画面生成。 2. AI生图:集成 Midjourney V7与夸克图片1.0 顶级美学: 接入了Midjourney V7模型。 本土化优化与易用性: 无需魔法,中文友好: 国内用户可以直接使用Midjourney V7模型,无需海外网络环境。 UI简化: 将MJ复杂的参数(如风格化、怪异化)做成了直观的滑块控制,方便调节。 辅助功能: 提供“智能润色”和“特征词库”等功能,帮助新手快速上手。 特色能力: 结合夸克自研技术,夸克图片1.0模型在亚洲人像、中文文字生成、国风元素等方面表现出色,适合电商、设计等场景。 产品体验与工作流 一站式创作流: 用户可以在平台内使用Midjourney V7生成高质量图片后,一键调用通义万相Wan2.5将图片转化为动态视频,整个创作流程非常顺畅。 双端体验: PC网页端: 提供功能最全面的专业创作体验,面向专业创作者。 夸克APP移动端: 提供轻量化的创作体验,以对话式交互为主,满足普通用户的趣味玩法和日常修图需求,如“一句话P图”、换发型、换背景、风格转换等。 价格与优惠活动 会员定价: 标准会员: 48元/月,可生成约400张MJ图片。相比Midjourney官方订阅(约70元/月生成200张),价格近乎“腰斩”。 高级会员: 188元/月,可生成约1800张MJ图片。 还有免费套餐,登录可获取每日积分。 限时免费活动: 活动时间: 即日起至9月30日。 活动内容: 所有用户均可享受7天免费体验通义万相Wan2.5的视频生成功能。 综上所述,“造点”是夸克在AIGC领域推出的一个旗舰级产品,它通过集成中外最顶尖的AI模型(通义万相2.5 + Midjourney V7),并辅以出色的本土化优化和极具竞争力的价格,为从专业创作者到普通用户的广泛人群提供了一个强大且易用的一站式AI内容创作平台。
create.qianwen.com -
百小应
百川智能发布最新一代基座大模型Baichuan 4,并推出成立之后的首款AI助手“百小应”。Baichuan 4相较Baichuan 3 在各项能力上均有极大提升,其中通用能力提升超过10%,数学和代码能力分别提升14%和9%,在国内权威大模型评测机构SuperCLUE的评测中,模型能力国内第一。此外,Baichuan 4还具备行业领先的多模态能力,在各大评测基准上表现优异,领先Gemini Pro、Claude3-sonnet等多模态模型。在Baichuan 4强大能力的基础上,百川智能将搜索技术与大模型深度融合,推出懂搜索、会提问的AI助手“百小应”。
yi.baichuan-ai.com -
腾讯元宝
腾讯元宝是基于腾讯混元大模型的AI助手应用,集成AI搜索、AI总结、AI写作、AI绘画等能力,同时支持创意绘画生图,帮助用户在工作、学习和生活中提高效率。
yuanbao.tencent.com