使用node爬取视频网站里《龙珠》m3u8视频

张

张建站

2026/7/22 15:29:18

10分钟阅读

1. 找到视频播放网站百度一下龙珠视频播放精挑细选一个可以播放的网站。如我在网上随便找了一个播放网站可以直接在线播放 https://www.xxx.com/play/39999-1-7.html这里不具体写视频地址了大家可以自行搜索2.分析网页DOM结构找出视频资源地址可以看到整块播放内容在 td#playleft 下的 iframe 引入。验证一下把 https://xxx/yun/?urlhttps://XXX/20221016/npV6fcC2/index.m3u8 地址在浏览器内直接访问发现可以正常播放视频那这串地址就是我们所需要的视频文件资源路径。那我们接下来就需要想办法根据这个路径把视频保存到本地。3.批量获取视频播放地址虽然通过第二步的操作我们可以拿到了第一话的视频资源地址但是是手动完成的。需要想办法能批量的拿到第一部153话的所有资源地址。想拿到所有视频的视频资源地址的前提是拿到所有视频的播放地址。所以我们要先想办法拿到每一集的播放地址。点击播放第1话第2话第3话 ,可以看到浏览器URL 分别是第1话 /play/39999-1-1.html第2话 /play/39999-1-2.html第3话/play/39999-1-3.html分析视频网站的地址不难看出规律递增n就可以获取到每一话的在线播放地址let n 1 let urlArr [] while(n 154){ urlArr.push(/play/39999-1- n.html ) n } console.log(urlArr )4.批量获取视频资源地址通过第三步我们已经拿到了每一话的播放地址那就要想办法拿到每一个播放地址下的td#playleft 下的 iframe 的 src。1.第一次尝试直接获取 /play/39999-1-1.html 的页面结构尝试从返回的dom中找到 td#playleft 下的 iframe。但是并没有找到相关的DOM推测应该是动态添加的节点第一次尝试失败var request require(request); request(https://www.xxx.com/play/39999-1-1.html, function (err, res, body) { console.log(err, res, body); });2.第二次尝试既然直接拿不到那就等页面加载完成再去拿所以第二种方案就是在本地项目中通过 iframe引入https://www.xxx.com/play/39999-1-1.html 等 iframe onload之后再去获取iframe.contentDocument 下的body iframe idiframe srchttps://www.xxx.com/dragon/39999-1-1.html onloadloadPage() frameborder0/iframe /body script function loadPage(e){ let iframe document.getElementsByTagName(iframe)[0] var iframeDocument iframe.contentDocument || iframe.contentWindow.document; console.log(iframeDocument ) } /script但是呢并没有拿到 ,虽然拿到了ifram的dom但是呢拿不到 contentDocument。这是为什么呢新机呲挖一呲冒黑套呲真相只有一个iframe src 的跨域问题方案二失败3.第三次尝试第三次的尝试是和第二次思路一样的所以主要任务是解决 iframe的跨域问题iframe idiframe src/dragon/39999-1-1.html onloadloadPage() frameborder0/iframe代理一下吧# 龙珠 server { listen 9001; location / { root E:/dragonBall; index index.html index.htm; try_files $uri $uri/ router; } location /dragon { proxy_pass https://www.xxx.com/play; } location /_guard { proxy_pass https://www.xxx.com; } location /template { proxy_pass https://www.xxx.com; } location /static { proxy_pass https://www.xxx.com; } }至此终于拿到了在线播放页面的全部DOM数据那么简单的处理下数据就可以拿到每一话的视频资源地址了这里直接循环了也可以直接使用第3步获取的视频播放地址逻辑是一致的script let num 1 let arr [] function loadPage(e){ arr localStorage.getItem(streamUrl) if(arr){ arr JSON.parse(arr) }else{ arr [] } if(num 154) return let iframe document.getElementsByTagName(iframe)[0] var iframeDocument iframe.contentDocument || iframe.contentWindow.document; var iframeElement iframeDocument.getElementById(playleft).getElementsByTagName(iframe)[0]; let streamUrl iframeElement.attributes.src.value.split(?url)[1] console.log(这是第 num 话:streamUrl) arr.push({ index:num, url:streamUrl }) num localStorage.setItem(streamUrl,JSON.stringify(arr)) iframe.src /dragon/39999-1-num.html } /script5.根据m3u8的资源地址下载视频首先封装一个下载视频的函数function downloadMedia (opt, callback) { // 测试视频如果链接失效的话就自己找一个 let url opt.url ; let output opt.output || video; let filename opt.index .mp4; let title opt.title || 测试视频; if (!fs.existsSync(output)) { fs.mkdirSync(output, { recursive: true, }); } (async function() { try { console.log(准备下载...); await converter .setInputFile(url) .setOutputFile(path.join(output, filename)) .start(); console.log(下载完成!); if ( typeof callback function ) callback(opt.index); } catch (error) { console.log(error) throw new Error(哎呀出错啦! 检查一下参数传对了没喔。, error); } })(); }然后再遍历一下我们拿到的视频资源地址轮询调用一下下载方法就可以了let arr [ { index: 1, url: https://xxx/20221016/npV6fcC2/index.m3u8 }, ... { index: 153, url: https://xxx/20221016/6AaX2hCl/index.m3u8 } ] let callback function(index){ let indexName arr[index - 1].index if(indexName.length 1){ indexName 00 indexName } if(indexName.length 2){ indexName 0 indexName } downloadMedia({url:arr[indexName].url,index:arr[indexName].index},callback) } downloadMedia({url:arr[0].url,index:001},callback)我现在设置的是一次下载1个文件也可以修改下同时下载多个注意别把视频网站搞崩了。总结主要问题还是获取到资源地址。处理好资源地址的问题就可以轮询下载了。附gitee源码仓库 - wangbanglei (wangbangleilei) - Gitee.com注仅供学习使用

终极Ventoy启动盘制作指南：一键打造多系统启动U盘

终极Ventoy启动盘制作指南：一键打造多系统启动U盘【免费下载链接】Ventoy A new bootable USB solution. 项目地址: https://gitcode.com/GitHub_Trending/ve/Ventoy Ventoy是一款革命性的开源启动盘制作工具，彻底改变了传统启动盘制作模式。只需…...

2026/5/8 21:02:45 阅读更多 →

GPT-6 Spud倒计时×AI格局变局：2026年4月第一周全景扫描

上一篇 OpenClaw生态模型使用量全景：国产模型主导12.96万亿Token时代下一篇 GPT-6 Spud深度解析：Symphony架构、双系统推理与OpenAI的AGI豪赌摘要 2026年4月第一周（3月31日至4月6日），AI行业迎来密集动态&#xff1a…...

2026/5/8 21:02:46 阅读更多 →

极限编程实践：测试驱动开发的真相

重新定义测试的角色定位在传统软件开发生命周期中，测试往往被视为开发的后置环节。而测试驱动开发（Test-Driven Development, TDD） 作为极限编程的核心实践，彻底颠覆了这一模式。对于软件测试从业者而言，TDD不仅是技术…...

2026/5/8 21:02:47 阅读更多 →

【AI问数】多智能体协同架构：行业首创的AI问数大脑

鲲溟智能 AI智能问数系列第15篇 | 2026-07-12 10 大智能体 Multi-Agent 协同架构端到端自动化 99.97% 可用性鲲溟智能首创10大智能体协同架构，是AI问数的大脑。每个Agent专精一个领域，通过Orchestrator智能编排，实现复杂任务的端到…...

2026/7/21 17:25:49 阅读更多 →

Kimi LeetCode 3621. 位计数深度为 K 的整数数目 I Python3实现

LeetCode 3621. 位计数深度为 K 的整数数目 I Python3 实现python from functools import lru_cacheclass Solution:def popcountDepth(self, n: int, k: int) -> int:# k0：只有 1 的深度为 0if k 0:return 1 if n > 1 else 0# 预处理 1~60 的 popcount-dept…...

2026/7/22 8:01:32 阅读更多 →

向量检索加速：ANN 索引选型和查询参数调优实战

向量检索加速：ANN 索引选型和查询参数调优实战基础设施不需要漂亮话。一个 100 万向量的知识库从"勉强能用"到"丝滑检索"，差距不在算法，在工程参数的调优。一、两个向量检索系统，性能差 20 倍团队内两套知…...

2026/7/22 8:01:25 阅读更多 →

鸿蒙 ArkTS 实战：Menu Nutrition Advice 从智能助手到保存闭环完整解析

鸿蒙 ArkTS 实战：Menu Nutrition Advice 从智能助手到保存闭环完整解析前言 Menu Nutrition Advice 是一个面向菜单营养建议的鸿蒙 ArkTS 单页工具。它把主题输入、数量统计、辅助开关、备注和保存状态组织到一个移动端工作台中。项目服务于根据餐单生成营养…...

2026/7/22 8:01:58 阅读更多 →