您好,欢迎来到 锐星AI网站导航官网 - 国内外1000+AI工具,发现好用AI,为你导航未来!
登录 / 注册 / 找回密码
全新的分类目录站点,点击去提交

  • VLog

    VLog

    给出一段长视频,我们把它变成一个包含视觉+音频信息的文档。通过将这份文件发送给ChatGPT,我们就可以在视频中进行聊天了!

    github.com/showlab/VLog - 2026-07-05 - 收藏
  • AudioGPT

    AudioGPT

    这是一个借助大语言模型(LLM)处理音频的工具,可以: – 生成音乐 – 背景音效 – 音频生成字幕 – 文字生成音频 – 文字生成音频并模拟声音 – 根据图片生成音频 – 对音频进行inpaint(局部屏蔽) – 根据音频和人脸照片合成视频 – 检测音频中的事件,以及开始和结束时间 – 单声道变双声道 – 通过文本描述检测特定声音发生的时间 – 抽取某种声音 – 去除背景噪音 多人混合声分离出单人声音 语音翻译 http://github.com/AIGC-Audio/AudioGPT 演示:https://huggingface.co/spaces/AIGC-Audio/AudioGPT 论文:https://arxiv.org/abs/2304.12995

    github.com/AIGC-Audio/AudioGPT - 2026-07-05 - 收藏
  • DWPose

    DWPose

    DWPose:用于检测视频中人物的动作 该系统基于MMPose和ControlNet,能够识别视频中的人物的面部和身体动作,为后续的SD绘图提供支持。

    github.com/IDEA-Research/DWPose - 2026-07-05 - 收藏
  • Vivus

    Vivus

    一个轻量级的 JavaScript(没有依赖项),为 SVG 设置动画,使它们看起来像是被绘制的。 提供多种不同的动画选择(延时、同步、连续、定时等),还可选择创建自定义脚本,以您喜欢的任何方式绘制 SVG。( SVG 源文件需要保留路径,使用路径描边生成的动画非常丝滑)

    maxwellito.github.io/vivus/ - 2026-07-05 - 收藏
  • Farm3D

    Farm3D

    牛津大学的研究人员提出了Farm3D:一个人工智能框架,可以通过提炼二维扩散来学习有关节的三维动物,用于视频游戏等实时应用

    farm3d.github.io - 2026-07-05 - 收藏
  • macOSpilot

    macOSpilot

    macOSpilot 是 Mac 上的一个多模态 AI 助手,能支持语音和截图,借助 GPT-4V 的多模态能力,可以基于当前屏幕截图和指令可以回复问题。

    github.com/elfvingralf/macOSpilot-ai-assistant - 2026-07-05 - 收藏
  • pdf2htmlEX

    pdf2htmlEX

    一个用于将PDF文件转换为HTML格式的开源工具。它是由coolwanglu在GitHub上开发和维护的。这个工具的主要功能是将PDF文件中的文本、图像、表格等内容提取出来,并将其转换为可以在网页浏览器中显示的HTML格式。 pdf2htmlEX支持多种操作系统,包括Windows、Linux和macOS。它具有简单易用的界面,用户只需通过简单的命令行操作即可完成PDF到HTML的转换。此外,pdf2htmlEX还提供了一些高级功能,如自定义输出样式、设置转换参数等,以满足不同用户的需求。

    github.com/coolwanglu/pdf2htmlEX - 2026-07-05 - 收藏
  • Chat with Hacker News

    Chat with Hacker News

    一个使用自然语言进行交流的应用程序,它是通过 OpenAI Functions 和 Vercel AI SDK 构建的。该应用程序允许用户使用自然语言与 Hacker News 进行对话。它的功能包括提问问题、获取新闻、搜索主题等。

    github.com/steven-tey/chathn - 2026-07-05 - 收藏
  • Chidori

    Chidori

    Chidori 是一种用于构建人工智能代理的反应式运行时。它为构建具有反应性、可观察性和鲁棒性的人工智能代理提供了一个框架。它支持使用 Node.js、Python 和 Rust 构建代理。 它目前处于 alpha 阶段,尚未准备好投入生产使用。我们将继续根据反馈意见做出重大修改。 – 从头开始构建代理 – 运行时由 Rust 编写,开箱即支持 Python 和 Node.js – 构建可实际运行的代理 – LLM 缓存可最大限度地降低开发成本 – 针对长时间运行的人工智能工作流进行了优化 – 嵌入式代码解释器 – 支持时间旅行调试

    github.com/ThousandBirdsInc/chidori - 2026-07-05 - 收藏
  • chat-llamaindex

    chat-llamaindex

    LlamaIndex 推出聊天机器人应用,支持设置prompt、上传文件聊天、分享聊天,基本是一键部署。

    github.com/run-llama/chat-llamaindex - 2026-07-05 - 收藏

推荐资讯

推荐站点

  • 造点造点

    核心功能与模型 “造点”平台的最大亮点是整合了业界顶尖的AI模型,实现了“强强联合”: 1. AI生视频:率先接入 通义万相 Wan2.5 全球首发/国内首个: 成为国内首个支持音画同步生成的平台。它可以在生成视频画面的同时,自动匹配人声、音效和背景音乐。 高质量输出: 支持生成长达10秒、1080P高清、24帧/秒的视频,画质可满足专业需求。 强指令遵循: 能够理解并执行复杂的指令,如运镜、视角切换等连续变化。 声音驱动: 用户可以在提示词中用引号(“”)来描述声音,实现声音驱动画面生成。 2. AI生图:集成 Midjourney V7与夸克图片1.0 顶级美学: 接入了Midjourney V7模型。 本土化优化与易用性: 无需魔法,中文友好: 国内用户可以直接使用Midjourney V7模型,无需海外网络环境。 UI简化: 将MJ复杂的参数(如风格化、怪异化)做成了直观的滑块控制,方便调节。 辅助功能: 提供“智能润色”和“特征词库”等功能,帮助新手快速上手。 特色能力: 结合夸克自研技术,夸克图片1.0模型在亚洲人像、中文文字生成、国风元素等方面表现出色,适合电商、设计等场景。 产品体验与工作流 一站式创作流: 用户可以在平台内使用Midjourney V7生成高质量图片后,一键调用通义万相Wan2.5将图片转化为动态视频,整个创作流程非常顺畅。 双端体验: PC网页端: 提供功能最全面的专业创作体验,面向专业创作者。 夸克APP移动端: 提供轻量化的创作体验,以对话式交互为主,满足普通用户的趣味玩法和日常修图需求,如“一句话P图”、换发型、换背景、风格转换等。 价格与优惠活动 会员定价: 标准会员: 48元/月,可生成约400张MJ图片。相比Midjourney官方订阅(约70元/月生成200张),价格近乎“腰斩”。 高级会员: 188元/月,可生成约1800张MJ图片。 还有免费套餐,登录可获取每日积分。 限时免费活动: 活动时间: 即日起至9月30日。 活动内容: 所有用户均可享受7天免费体验通义万相Wan2.5的视频生成功能。 综上所述,“造点”是夸克在AIGC领域推出的一个旗舰级产品,它通过集成中外最顶尖的AI模型(通义万相2.5 + Midjourney V7),并辅以出色的本土化优化和极具竞争力的价格,为从专业创作者到普通用户的广泛人群提供了一个强大且易用的一站式AI内容创作平台。

    create.qianwen.com
  • 百小应百小应

    百川智能发布最新一代基座大模型Baichuan 4,并推出成立之后的首款AI助手“百小应”。Baichuan 4相较Baichuan 3 在各项能力上均有极大提升,其中通用能力提升超过10%,数学和代码能力分别提升14%和9%,在国内权威大模型评测机构SuperCLUE的评测中,模型能力国内第一。此外,Baichuan 4还具备行业领先的多模态能力,在各大评测基准上表现优异,领先Gemini Pro、Claude3-sonnet等多模态模型。在Baichuan 4强大能力的基础上,百川智能将搜索技术与大模型深度融合,推出懂搜索、会提问的AI助手“百小应”。

    yi.baichuan-ai.com
  • 腾讯元宝腾讯元宝

    腾讯元宝是基于腾讯混元大模型的AI助手应用,集成AI搜索、AI总结、AI写作、AI绘画等能力,同时支持创意绘画生图,帮助用户在工作、学习和生活中提高效率。

    yuanbao.tencent.com