Đạo đức Web Scraping: Hướng dẫn thực tiễn cho các đội ngũ có trách nhiệm

EVOproxy Team
Đạo đức Web Scraping: Hướng dẫn thực tiễn cho các đội ngũ có trách nhiệm

Công việc giám sát giá của bạn đang chạy qua đêm, các tài khoản mạng xã hội của bạn cần kiểm tra theo vị trí cụ thể, và một cuộc kiểm tra xác minh quảng cáo đã chờ sẵn trong hàng đợi. Phần kỹ thuật thì đơn giản: phân phối yêu cầu, phân tích phản hồi, xoay vòng kết nối, và lưu trữ các trường mà bảng điều khiển của bạn cần. Câu hỏi khó là liệu việc thu thập có được bảo vệ hay không, dựa trên những gì trang web đã công khai, những gì người dùng của nó mong đợi, và tải mà hệ thống của bạn tạo ra.

Đạo đức web scraping không chỉ là một ô được đánh dấu “đã kiểm tra robots.txt.” Nó kết hợp phán đoán pháp lý, kỷ luật về quyền riêng tư, xác định danh tính trung thực, quản lý lưu lượng cẩn thận, và lựa chọn proxy phù hợp với nhiệm vụ. Một trình thu thập dữ liệu có thể truy cập một trang mà không cần chứng minh rằng việc thu thập là phù hợp. Các nhóm có trách nhiệm thiết kế để duy trì quyền truy cập và hạn chế thiệt hại, không phải để giữ cho mình không bị phát hiện bằng bất kỳ giá nào.

Tại sao Đạo đức Web Scraping Quan trọng trong Các Dự án Thực tế

Một nhóm phân tích thương mại điện tử vừa đã từng coi tốc độ là yêu cầu chính trong việc giao hàng. Để theo kịp với một danh mục được làm mới hàng giờ, các kỹ sư đã phân tán một trình thu thập thông tin giá qua 200 luồng. Mục tiêu là một nhà bán lẻ nhỏ hơn với cơ sở hạ tầng hạn chế. Trong một khoảng thời gian bận rộn, cửa hàng của nhà bán lẻ đã không khả dụng trong sáu giờ, nhà bán lẻ đã gửi một thông báo ngừng và nhóm phân tích đã mất hợp đồng mà họ đã cố gắng giành được.

Sự thất bại không phải là một sự xâm nhập kịch tính. Đó là một quyết định sản xuất đã bỏ qua khả năng của mục tiêu. Mô hình tương tự xuất hiện dưới những hình thức ít rõ ràng hơn: các lệnh giới hạn tỷ lệ ngắt quãng việc giám sát, các IP bị chặn làm hỏng tập dữ liệu với các trang thách thức, và các cách làm việc lặp đi lặp lại làm tăng chi phí kỹ thuật. Một nhóm coi mỗi phản hồi là sự cho phép cuối cùng sẽ dành nhiều thời gian hơn để sửa chữa quyền truy cập hơn là sản xuất dữ liệu hữu ích.

Quy tắc hoạt động: Nếu phương pháp thu thập của bạn khó giải thích cho chủ sở hữu trang web, hãy tạm dừng trước khi mở rộng nó.

Trước khi khởi động một quy trình trích xuất dữ liệu web mới, hãy tài liệu hóa mục tiêu, mục đích, các trường, mẫu yêu cầu dự kiến, và các điều kiện dừng. Tài liệu không làm cho một cuộc thu thập dữ liệu xâm lấn trở nên chấp nhận được, nhưng nó phơi bày các giả định trước khi chúng trở thành sự cố. Nó cũng cung cấp cho các chủ sở hữu tuân thủ, an ninh, và kỹ thuật một cái gì đó cụ thể để xem xét.

Đạo đức là một chiến lược phục hồi

Các công việc lịch sự thường có khả năng sử dụng lâu dài. Chúng giảm khả năng bị chặn, bảo tồn chất lượng phản hồi, và làm cho các thay đổi dễ chẩn đoán hơn. Một cuộc thu thập dữ liệu chậm hơn mà trả về các hồ sơ sản phẩm đầy đủ thường có giá trị hơn một cuộc thu thập nhanh chóng đầy các trang bị thiếu, phản hồi thách thức, và các lần thử lại bị trùng lặp.

Cuộc tranh chấp 2000 eBay v. Bidder's Edge cơ bản vẫn được trích dẫn rộng rãi vì tòa án đã phát hiện rằng Bidder's Edge đã thực hiện khoảng 100,000 yêu cầu mỗi ngày tới eBay, kết nối việc thu thập tự động với gánh nặng hoạt động thay vì coi khả năng truy cập công khai là sự cho phép không giới hạn. Vụ việc được thảo luận trong một bài đánh giá về đạo đức web scraping và vụ tranh chấp eBay, và bài học thực tiễn của nó vẫn hữu ích: tác động hạ tầng là quan trọng.

Câu hỏi tốt hơn không chỉ là “Liệu trình thu thập có thể lấy trang này không?” Hãy hỏi liệu tài liệu có được công khai một cách có chủ đích trong một bối cảnh gợi ý tái sử dụng, liệu khối lượng của bạn có tương xứng, và liệu mục đích của bạn có phù hợp với mong đợi hợp lý của khán giả hay không. Ống kính hợp pháp theo bối cảnh đó nên hướng dẫn mọi lựa chọn kỹ thuật tiếp theo.

Bối cảnh Pháp lý và Quy định Bạn Nên Tôn Trọng

Luật thu thập dữ liệu thay đổi theo khu vực pháp lý, cấu trúc hợp đồng, loại dữ liệu, và cách thức chính xác mà một hệ thống được truy cập. Hãy coi những điều sau đây như một bản đồ hoạt động, không phải là lời khuyên pháp lý. Một cuộc xem xét của luật sư là phù hợp khi dự án liên quan đến dữ liệu cá nhân, các khu vực xác thực, nội dung sáng tạo, thu thập khối lượng lớn, hoặc nhiều quốc gia.

Bốn khung yêu cầu xem xét riêng biệt

Bản quyền thường tập trung vào sự biểu đạt sáng tạo, không phải là các sự kiện riêng lẻ. Giá sản phẩm, trạng thái tồn kho, và các định danh khác nhau với việc sao chép các mô tả đầy đủ, bài viết, hình ảnh, hoặc cách trình bày gốc của một trang web. Tại Liên minh Châu Âu, một cơ sở dữ liệu có cấu trúc cũng có thể nhận được sự bảo vệ thông qua một quyền cơ sở dữ liệu riêng biệt, vì vậy việc trích xuất các trường thông tin không tự động loại bỏ mọi rủi ro.

Các lý thuyết về lạm dụng máy tính và xâm phạm tài sản tập trung vào quyền truy cập và can thiệp. Khả năng truy cập công khai có thể quan trọng, nhưng nó không tạo ra một nơi trú ẩn an toàn phổ quát. Dòng dõi hiQ v LinkedIn của Mỹ có liên quan đến dữ liệu công khai, trong khi các tranh chấp sau này, bao gồm vụ kiện của Meta chống lại Bright Data, cho thấy rằng các ranh giới xác thực, rào cản kỹ thuật, bằng chứng, và điều khoản hợp đồng có thể thay đổi phân tích. Đạo luật Lạm dụng Máy tính của Vương quốc Anh thêm một lớp cụ thể theo khu vực pháp lý khác.

Điều khoản dịch vụ tạo ra một câu hỏi hợp đồng. Các điều khoản của một trang web có thể hạn chế quyền truy cập tự động ngay cả khi các trang tải mà không cần đăng nhập. Liệu các điều khoản đó có ràng buộc một người dùng cụ thể hay không phụ thuộc vào cách chúng được trình bày, chấp nhận, và áp dụng, vì vậy đừng giả định rằng một URL công khai giải quyết vấn đề.

Luật bảo vệ dữ liệu có thể áp dụng khi các trường được thu thập liên quan đến những người có thể nhận diện. Các nghĩa vụ theo GDPR, UK GDPR, và CCPA có thể yêu cầu một mục đích được tài liệu hóa, cơ sở hợp pháp, kiểm soát truy cập, giới hạn lưu giữ, và đôi khi là một đánh giá tác động bảo vệ dữ liệu. Khả năng nhìn thấy công khai không loại bỏ phân tích quyền riêng tư.

Khung Pháp lý Điều gì được bảo vệ Kích hoạt Thu thập Thông thường Cảnh báo Chính
Bản quyền Sự biểu đạt sáng tạo và các tập hợp được bảo vệ Sao chép văn bản, hình ảnh, bố cục, hoặc tài liệu cơ sở dữ liệu đáng kể Các sự kiện và biểu đạt yêu cầu phân tích khác nhau
Lạm dụng máy tính Các hệ thống, ranh giới truy cập, và cơ sở hạ tầng Vượt qua xác thực hoặc gây can thiệp có hại Truy cập công khai không giải quyết mọi yêu cầu
Hợp đồng và điều khoản Các điều kiện sử dụng đã thỏa thuận Quyền truy cập tự động bị cấm bởi các điều khoản đã chấp nhận Tính khả thi phụ thuộc vào thông báo và chấp nhận
Bảo vệ dữ liệu Các cá nhân có thể nhận diện và thông tin của họ Thu thập, liên kết, lưu trữ, hoặc lập hồ sơ dữ liệu cá nhân Cơ sở hợp pháp và tính tương xứng vẫn quan trọng

Đừng xây dựng một chiến lược tuân thủ xung quanh việc đánh bại một CAPTCHA. Một CAPTCHA là một tín hiệu kiểm soát truy cập, và hướng dẫn xử lý CAPTCHA có trách nhiệm nên dẫn đến một khoảng dừng, yêu cầu sự cho phép, hoặc lộ trình truy cập được chấp thuận, không phải là một con đường leo thang. Hãy tài liệu hóa quyết định và liên hệ với luật sư khi hậu quả là quan trọng.

robots.txt, Điều khoản Dịch vụ, và Quy tắc Trang web

Các tín hiệu này không thể thay thế cho nhau. robots.txt là một tệp hướng dẫn có thể đọc được bởi máy móc, thường được đặt ở gốc của một trang web, chỉ ra các trình thu thập dữ liệu nào có thể truy cập các đường dẫn cụ thể và có thể gợi ý các độ trễ. Giải thích của Mozilla về robots.txt mô tả vai trò của nó như một tín hiệu cho phép thu thập dữ liệu, trong khi phân tích pháp lý làm rõ rằng nó không phải là một khóa kỹ thuật hoặc rào cản có thể thực thi phổ quát.

Một trình thu thập dữ liệu nên lấy và phân tích tệp trước khi yêu cầu các trang, sau đó áp dụng các quy tắc theo URL và theo user-agent. Các ký tự đại diện, tiền tố đường dẫn, nhóm cụ thể cho bot, và chỉ thị độ trễ có thể bị hiểu sai, vì vậy hãy sử dụng một bộ phân tích đã được kiểm tra thay vì một kiểm tra chuỗi nhanh. Một quy tắc không cho phép nên được coi là một tín hiệu có ý nghĩa về ý định của người điều hành, ngay cả khi giao thức tự nó không thể buộc tuân thủ.

Điều khoản dịch vụ nằm ở một lớp khác. Chúng có thể chứa các hạn chế về quyền truy cập tự động, sao chép, sử dụng tài khoản, hoặc tái sử dụng thương mại. Nếu quy trình làm việc của bạn đăng nhập, chấp nhận một thỏa thuận nhấp chuột rõ ràng, hoặc sử dụng một tài khoản đối tác, phân tích hợp đồng trở nên nghiêm trọng hơn. Một nhóm không nên ẩn mình sau thực tế rằng một trình duyệt có thể tải một trang nếu con đường truy cập của chính nó đã chấp nhận các hạn chế.

Sử dụng kênh có rủi ro thấp nhất có thể

Một API chính thức, nguồn cấp đối tác, sơ đồ trang web, xuất khẩu, hoặc sự cho phép bằng văn bản có thể loại bỏ sự không chắc chắn và cải thiện tính ổn định của dữ liệu. Nó có thể áp đặt giới hạn hoặc bỏ qua các trường, nhưng những hạn chế đó thường rẻ hơn so với việc duy trì một trình thu thập dữ liệu thường xuyên va chạm với các quy tắc của trang web.

Tín hiệu Nơi nó tồn tại Nó thực thi điều gì Nó không thực thi điều gì
robots.txt Gốc trang, thường là /robots.txt Giao tiếp quyền truy cập thu thập dự kiến Không xác thực người dùng hoặc chặn yêu cầu về mặt kỹ thuật
Điều khoản dịch vụ Các trang pháp lý hoặc tài khoản, quy trình nhấp qua Có thể tạo ra các hạn chế hợp đồng Không tự động giải quyết nghĩa vụ bản quyền hoặc quyền riêng tư
Quy tắc API Tài liệu cho nhà phát triển, đối tác hoặc tài khoản Xác định quyền truy cập được phê duyệt, hạn ngạch và các trường Không cấp phép cho việc thu thập không liên quan

Giữ một dấu vết chứng cứ. Lưu phiên bản của các quy tắc bạn đã xem xét, ngày xem xét, danh tính user-agent đã sử dụng và chủ sở hữu chịu trách nhiệm cho việc đánh giá lại. Chính sách trang web có thể thay đổi, và một lần thu thập mà trước đó được chấp nhận có thể cần phải dừng lại sau này.

Giới hạn tỷ lệ, Lịch sự và Tải máy chủ

Lịch sự bắt đầu từ máy chủ mục tiêu, không phải tổng dự án. Định nghĩa tỷ lệ yêu cầu theo miền, giới hạn đồng thời theo miền và theo IP, và tính đến trọng lượng trang, thời gian phản hồi và chi phí hiển thị. Một hàng đợi với một giới hạn toàn cầu vẫn có thể làm quá tải một máy chủ nhỏ nếu nó gửi mọi công nhân đến cùng một nguồn gốc.

Xây dựng một cuốn sách chạy lùi

  1. Đặt một mức cơ bản bảo thủ. Sử dụng tỷ lệ yêu cầu thấp và số lượng kết nối đồng thời hạn chế theo máy chủ. Tăng chỉ khi trang web phản hồi nhất quán và chủ sở hữu cho phép hoạt động này.
  2. Lên lịch một cách thông minh. Ưu tiên các khoảng thời gian ngoài giờ cao điểm dựa trên múi giờ của trang web khi có thể. Tránh khởi động lại toàn bộ trong thời gian bán hàng, phát hành sản phẩm hoặc sự kiện có nhu cầu cao khác.
  3. Xác định trình thu thập dữ liệu. Sử dụng một User-Agent trung thực với một URL hoặc email liên hệ. Đừng giả mạo trình duyệt để che giấu tự động hóa.
  4. Đọc tín hiệu phản hồi. Xem xét các phản hồi 429, độ trễ tăng, thời gian chờ và lỗi 5xx như là các chỉ số áp lực. Tôn trọng Retry-After khi được cung cấp.
  5. Dừng lại một cách sạch sẽ. Thêm thời gian chờ theo cấp số nhân, thử lại ngẫu nhiên và một bộ ngắt mạch cứng. Bộ ngắt mạch nên dừng công việc khi có lỗi hoặc độ trễ vượt quá ngưỡng đã được tài liệu hóa của bạn.

Một sơ đồ minh họa các bước để quản lý giới hạn tỷ lệ thu thập dữ liệu web, lịch sự và giảm tải máy chủ.

Một danh tính có thể liên hệ giúp các nhà điều hành có một lộ trình để giải quyết sai sót. Nó cũng giúp nhóm của bạn phân biệt một lỗi ứng dụng tạm thời với một chặn có chủ ý. Nếu chủ sở hữu yêu cầu bạn giảm lưu lượng hoặc dừng lại, hãy ghi lại yêu cầu, thông báo cho chủ dự án và tạm ngừng phạm vi bị ảnh hưởng cho đến khi ai đó xem xét nó.

Sự phân biệt thực tiễn: Lịch sự không có nghĩa là vô hình. Nó có nghĩa là có thể xác định, tỷ lệ hợp lý và sẵn sàng dừng lại.

CAPTCHA không nên kích hoạt việc quay vòng mạnh mẽ hơn hoặc thử lại nhiều lần. Chúng chỉ ra rằng các biện pháp kiểm soát rủi ro của trang web đã được kích hoạt. Tăng cường vào thời điểm đó có thể làm tăng tải, làm suy yếu niềm tin và đưa dự án ra ngoài một mẫu truy cập có thể bảo vệ.

Quyền riêng tư, Giảm thiểu dữ liệu và Phù hợp với mục đích

Một danh mục sản phẩm có thể trông vô hại cho đến khi một lần thu thập lưu trữ tên người đánh giá, liên kết hồ sơ và văn bản bình luận cùng với giá cả. Rủi ro tăng lên khi một hệ thống kết hợp các bản ghi từ nhiều nguồn, xây dựng lịch sử cá nhân hoặc làm cho tập dữ liệu kết hợp có thể tìm kiếm ở quy mô lớn. Áp dụng kỷ luật theo kiểu GDPR ngay cả khi dự án có thể không thuộc GDPR. Câu hỏi thực tiễn rất đơn giản: các trường nào là cần thiết cho đầu ra hạ nguồn?

Chỉ thu thập những gì đầu ra yêu cầu

Đối với việc theo dõi giá, các trường hữu ích có thể là mã sản phẩm, giá niêm yết, tiền tệ, trạng thái tồn kho, dấu thời gian và URL nguồn. Tên người đánh giá, liên kết hồ sơ hoặc bình luận văn bản tự do thường không thêm gì vào báo cáo đó. Loại bỏ các trường không cần thiết khi nhập. Đừng thu thập mọi thứ trước và dựa vào một bước dọn dẹp sau đó.

Phù hợp với mục đích phụ thuộc vào nhiều hơn là sự hiển thị của trang. Hướng dẫn năm 2025 liên kết với CNIL về việc thu thập dữ liệu cho phát triển AI dựa trên lý luận của EDPB rằng việc thu thập nên tập trung vào tài liệu được công khai miễn phí và có chủ ý. Nó cũng chỉ ra sự thận trọng xung quanh các diễn đàn sức khỏe, cơ sở dữ liệu gia phả và không gian xã hội công cộng nơi mọi người có thể không mong đợi việc tái sử dụng hàng loạt.

Trước khi nhập một trường, hãy hỏi:

  • Công khai theo ý định: Người hoặc tổ chức có công bố nó một cách có chủ ý để tái sử dụng rộng rãi, hay nó chỉ có thể truy cập thông qua một trang không rõ ràng?
  • Kỳ vọng theo ngữ cảnh: Một người dùng hợp lý có thể mong đợi sự tổng hợp, làm phong phú hoặc đào tạo mô hình không?
  • Mục đích tỷ lệ: Trường đó có hỗ trợ trực tiếp cho báo cáo, thử nghiệm hoặc sản phẩm đã nêu không?

Xem xét thông tin sức khỏe, quan điểm chính trị, dữ liệu của trẻ em và chi tiết danh tính nhạy cảm như là bị loại trừ theo giả định. Chỉ có sự hiển thị không đủ để biện minh cho một doanh nghiệp.

Bảo quản là một phần của thiết kế

Đặt một khoảng thời gian bảo quản trước lần thu thập đầu tiên. Tách biệt các phản hồi thô từ các bản ghi đã chuẩn hóa, hạn chế quyền truy cập, mã hóa các kho nhạy cảm, ghi lại xuất khẩu và xóa dữ liệu theo lịch trình. Một cơ sở hợp pháp, đánh giá lợi ích hợp pháp hoặc quyết định đồng ý không miễn trừ việc thu thập quá mức. Sự hiển thị công khai cũng không cho phép một trình thu thập suy ra sự đồng ý một cách tùy tiện.

Đối với công việc AI hoặc phân tích, hãy bảo tồn tuyên bố mục đích và lý do cho mỗi trường đã thu thập. Đánh giá lại dự án nếu nó thay đổi từ so sánh giá sang tạo ra khách hàng tiềm năng hoặc lập hồ sơ. Một mục đích mới có thể khiến việc thu thập trước đó trở nên không tỷ lệ. Khi điều đó xảy ra, tạm dừng việc nhập mới, hạn chế quyền truy cập hiện tại và ghi lại liệu việc xóa hay một tập dữ liệu hẹp hơn là phù hợp.

Vệ sinh Proxy và Quản lý Dấu chân

Một proxy có thể phân phối lưu lượng, hỗ trợ kiểm tra địa lý hoặc ngăn một địa chỉ mang một phần không hợp lý của các yêu cầu. Nó không được trở thành một phương pháp để che giấu lạm dụng hoặc vượt qua các kiểm soát truy cập rõ ràng. Chọn cơ sở hạ tầng chỉ sau khi xác nhận rằng mục đích thu thập là tỷ lệ và mục tiêu cho phép quy trình làm việc.

Proxy trung tâm dữ liệu sử dụng địa chỉ mạng lưu trữ. Định tuyến của chúng là có thể dự đoán, phân loại ASN thường đơn giản, và sở hữu tập trung có thể làm cho chúng dễ dàng lọc. Chúng vẫn phù hợp cho các trang công khai có rủi ro thấp khi truy cập tự động được cho phép và khối lượng yêu cầu được kiểm soát.

Proxy dân cư sử dụng địa chỉ liên quan đến mạng tiêu dùng. Lưu lượng của chúng có thể giống như truy cập hộ gia đình thông thường, nhưng điều đó không xác lập tính hợp pháp. Xác minh nguồn gốc, sự đồng ý, điều khoản sử dụng chấp nhận và độ chính xác địa lý trước khi triển khai.

Proxy di động sử dụng mạng 4G hoặc 5G của nhà mạng. Các nhà mạng di động thường sử dụng NAT cấp nhà mạng, hoặc CGNAT, cho phép nhiều thuê bao chia sẻ địa chỉ IPv4 công cộng. RFC 6598 dự trữ 100.64.0.0/10 cho mục đích chia sẻ này, và dấu chân chia sẻ giúp giải thích lý do tại sao các IP di động có thể khó bị cô lập và chặn hơn so với các địa chỉ trung tâm dữ liệu đơn lẻ, như đã mô tả trong hướng dẫn kỹ thuật về CGNAT và nhận diện proxy di động.

Loại Proxy Dấu chân điển hình Khả năng phát hiện Trường hợp sử dụng phù hợp nhất
Trung tâm dữ liệu Mạng lưu trữ hoặc đám mây Thường dễ phân loại ở cấp độ ASN Thu thập công khai được phép, rủi ro thấp
Dân cư Mạng ISP tiêu dùng Hỗn hợp hơn, nhưng nguồn gốc cần xem xét Nghiên cứu địa lý và mẫu duyệt web thông thường
Di động Mạng nhà mạng, thường được chia sẻ qua CGNAT Ngữ cảnh nhà mạng có thể khó bị cô lập Kiểm tra QA ứng dụng di động, kiểm tra nhạy cảm địa lý và quy trình xã hội được quản lý cẩn thận

Quay vòng cần quy tắc liên tục

Một phiên quay vòng gán một IP mới cho mỗi yêu cầu. Một phiên dính giữ nguyên IP trong một khoảng thời gian xác định, hỗ trợ kiểm tra đăng nhập, xác minh tài khoản và QA dài hạn. Một triển khai đã được tài liệu cho phép các phiên dính lên đến 43,200 phút, hoặc 30 ngày, như được thể hiện trong tài liệu phiên proxy.

Quá nhiều lần quay có thể làm hỏng cookie, tạo ra những đợt bất thường và khiến hành trình của người dùng bình thường trở nên phân mảnh. Quá ít lần quay có thể tập trung quá nhiều yêu cầu vào một IP. Chọn chế độ theo quy trình làm việc, thay vì áp dụng một quy tắc cho mọi lần thu thập dữ liệu.

Giữ cho phần còn lại của dấu chân nhất quán. Khớp múi giờ và địa phương với địa lý đã được phê duyệt, duy trì tiêu đề nhất quán và tránh tín hiệu trình duyệt mâu thuẫn. Nhận dạng TLS, bao gồm các kỹ thuật JA3 và JA4, cộng với các tín hiệu cấp trình duyệt có thể tiết lộ tự động hóa ngay cả khi IP có vẻ hợp lý. Phân loại ASN cũng quan trọng vì các hệ thống rủi ro có thể phân biệt giữa mạng di động, ISP tiêu dùng và mạng lưu trữ trước khi áp dụng các biện pháp kiểm soát.

Sử dụng lớp proxy nhẹ nhất mà mục tiêu và mục đích yêu cầu. Nếu một kết nối trung tâm dữ liệu hoạt động theo quy tắc của trang web, đừng chuyển sang di động chỉ để giảm phát hiện. Nếu lưu lượng di động là cần thiết cho một bài kiểm tra nhạy cảm về địa lý hoặc ứng dụng, hãy ghi lại lý do, phạm vi và điều kiện dừng. Các nhóm xem xét hạ tầng proxy cho việc thu thập dữ liệu tuân thủ nên tài liệu hóa những quyết định đó cùng với hành vi quay vòng, lựa chọn ASN và quy trình dừng thu thập khi mục tiêu cho thấy căng thẳng hoặc quy tắc truy cập thay đổi.

Các nghiên cứu trường hợp về thu thập dữ liệu có trách nhiệm

Các sự cố hữu ích nhất không phải là những câu chuyện về kẻ xấu. Chúng là hồ sơ của các nhóm bình thường đã tối ưu hóa một biến và quên đi hệ thống xung quanh.

Trường hợp A, thông tin giá trong một đợt giảm giá chớp nhoáng

Một nhóm thông tin giá đã gửi yêu cầu trang sản phẩm với 20 yêu cầu mỗi giây trong một đợt giảm giá chớp nhoáng. Một nhà bán lẻ nhỏ đã gặp sự cố về khả năng cung cấp, sau đó đã liên hệ trực tiếp với nhóm. Nhóm có lý do kinh doanh cho sự tươi mới, nhưng họ chưa đánh giá khả năng của mục tiêu hoặc xác định được một người có thể giải thích lưu lượng truy cập.

Giải pháp là hoạt động chứ không phải thẩm mỹ. Các kỹ sư đã thêm giới hạn thích ứng theo miền, sử dụng một chuỗi nhận dạng với một email liên hệ, và chuyển việc thu thập định kỳ vào các khoảng thời gian thấp điểm đã lên lịch. Họ cũng đã làm cho trình thu thập tạm dừng khi độ trễ và tỷ lệ lỗi tăng lên, thay vì coi các phản hồi không hoàn chỉnh là lý do để thử lại mạnh mẽ hơn.

Bài học là cụ thể: yêu cầu về sự tươi mới không vượt qua giới hạn cấp máy chủ. Nếu các cập nhật hàng giờ yêu cầu áp lực hơn mức mà trang web có thể chịu đựng, hãy thương lượng quyền truy cập, giảm tập hợp trường, sử dụng nguồn cấp dữ liệu được phép, hoặc thay đổi lời hứa sản phẩm.

Trường hợp B, dữ liệu tuyển dụng và các định danh gián tiếp

Một dự án dữ liệu tuyển dụng đã thu thập các trang hồ sơ chứa tên liên quan đến lịch sử việc làm. Nhóm ban đầu đã coi thông tin này là dữ liệu chuyên nghiệp công khai. Trong một cuộc xem xét, họ nhận ra rằng các trường có thể xác định lại cá nhân khi kết hợp với các nguồn công khai khác.

Nhóm đã loại bỏ các trường ngoài chức danh công việc và công ty, rút ngắn thời gian lưu giữ xuống còn 30 ngày, và tài liệu hóa cơ sở hợp pháp cho việc xử lý còn lại. Họ cũng đã tách câu hỏi về việc thu thập có khả thi về mặt kỹ thuật hay không khỏi việc hiệu ứng kết hợp của tập dữ liệu có tỷ lệ hợp lý hay không.

Không có kịch bản nào yêu cầu ý định xấu để tạo ra rủi ro. Các lỗi đến từ việc thiếu quyền sở hữu, mặc định yếu, và sự thất bại trong việc đánh giá lại mục đích sau khi thiết kế thu thập dữ liệu thay đổi. Các nhóm trưởng thành biến những sự cố đó thành các biện pháp kiểm soát, không chỉ là những lời nhắc nhở.

Danh sách kiểm tra nhóm và các bước tiếp theo

Một lần thu thập dữ liệu nên có một người sở hữu, một mục đích bằng văn bản, và một điều kiện dừng trước khi có hàng đợi công nhân. In danh sách kiểm tra dưới đây và gán mỗi mục cho một người hoặc nhóm đã được chỉ định.

Các biện pháp kiểm soát trước khi thu thập dữ liệu

  • Xác định mục đích: Viết câu hỏi kinh doanh, nguồn mục tiêu, đầu ra yêu cầu, và các sử dụng bị cấm.
  • Kiểm tra robots.txt: Lấy tệp hiện tại của trang web, phân tích các quy tắc cho user-agent dự định, và kiểm tra mọi đường dẫn trong hàng đợi.
  • Xem xét điều khoản: Ghi lại các điều khoản truy cập tự động, tài khoản, sao chép, và sử dụng thương mại. Tăng cường các hạn chế không rõ ràng.
  • Chọn kênh truy cập: Kiểm tra xem có API, nguồn cấp đối tác, xuất khẩu, sơ đồ trang web, hoặc sự cho phép bằng văn bản trước khi xây dựng một trình thu thập dữ liệu.
  • Xác nhận cơ sở hợp pháp: Nếu dữ liệu cá nhân xuất hiện, hãy tài liệu hóa cơ sở, phân tích tỷ lệ, các khu vực bị ảnh hưởng, và người xem xét có trách nhiệm.
  • Đặt thời gian lưu giữ: Chọn ngày xóa cho các phản hồi thô, hồ sơ đã chuẩn hóa, nhật ký, và tập dữ liệu đã suy diễn.
  • Giảm thiểu các trường: Tạo một danh sách cho phép. Từ chối các trường không hỗ trợ mục đích đã nêu.
  • Đặt chính sách proxy: Chọn truy cập trung tâm dữ liệu, dân cư, hoặc di động dựa trên nhu cầu thực tế. Ghi lại kỳ vọng ASN, chế độ quay vòng, địa lý, và xem xét nguồn.

Trong quá trình thu thập dữ liệu

  • Tôn trọng giới hạn máy chủ: Áp dụng tỷ lệ yêu cầu theo miền, giới hạn đồng thời, giới hạn kích thước phản hồi, và điều chỉnh thích ứng.
  • Xác định bot: Sử dụng User-Agent trung thực và một tuyến liên hệ. Giữ cho danh tính nhất quán.
  • Tôn trọng Retry-After: Trì hoãn khi được chỉ định, và giảm bớt khi gặp 429, 403, 5xx, thời gian chờ, và độ trễ tăng.
  • Tránh nhu cầu cao điểm: Chạy các công việc đã lên lịch trong các khoảng thời gian thấp điểm đã phê duyệt khi có thể.
  • Dừng lại khi gặp chặn mềm: Xem các trang CAPTCHA, chuyển hướng bất thường, vòng đồng ý, và phản hồi thách thức như là tín hiệu để tạm dừng.
  • Ghi lại quyết định: Lưu trữ thời gian yêu cầu, loại phản hồi, loại ASN proxy, trạng thái phiên, và các sự kiện điều chỉnh mà không thu thập các bí mật không cần thiết.
  • Bảo vệ thông tin xác thực: Giữ cho các mã thông báo, cookie, và dữ liệu tài khoản ra khỏi nhật ký của trình thu thập dữ liệu và chuỗi User-Agent.

Danh sách kiểm tra nhóm thu thập dữ liệu web có đạo đức, chi tiết các thực hành tốt nhất trước khi thu thập, trong quá trình thu thập, và sau khi thu thập.

Phản ứng sau khi thu thập và sự cố

  • Lọc khi nhập: Loại bỏ các trường đã lọt qua danh sách cho phép trước khi các nhà phân tích hoặc mô hình có thể truy cập chúng.
  • Bảo mật tập dữ liệu: Áp dụng các biện pháp kiểm soát truy cập, mã hóa, ghi nhật ký kiểm toán, và phân tách môi trường.
  • Xóa theo lịch: Xóa các hồ sơ thô và đã suy diễn hết hạn. Xác minh việc xóa thay vì dựa vào nhắc nhở lịch.
  • Ghi nguồn: Bảo tồn các URL nguồn và ngữ cảnh thu thập khi thích hợp, mà không công bố lại các biểu thức được bảo vệ.
  • Kiểm toán việc sử dụng proxy: Xem xét loại ASN, hành vi quay vòng, yêu cầu phiên dính, địa lý, và xem liệu lớp đã chọn có quá mức hay không.
  • Đặt tên một liên hệ: Cung cấp cho các nhà điều hành trang web một tuyến đường leo thang thực sự và chỉ định một người sở hữu sự cố nội bộ.
  • Chuẩn bị các bước gỡ bỏ: Dừng công việc bị ảnh hưởng, bảo tồn các nhật ký liên quan, thông báo cho các chủ sở hữu pháp lý và an ninh, phản hồi cho nhà điều hành, và xóa dữ liệu khi việc xem xét yêu cầu.

Một thang đo trưởng thành thực tiễn

Vệ sinh tối thiểu có nghĩa là nhóm kiểm tra quyền, giới hạn lưu lượng, giảm thiểu các trường, và có một công tắc dừng. Quản trị đã được tài liệu hóa thêm các chủ sở hữu, lịch trình lưu giữ, xem xét nguồn, và hồ sơ sự cố. Độ hợp pháp theo ngữ cảnh được xem xét theo từng nguồn đi xa hơn bằng cách hỏi liệu tài liệu có được công khai một cách có chủ đích hay không, liệu người dùng có mong đợi loại tái sử dụng này hay không, và liệu việc thu thập vẫn tỷ lệ với mục đích thực tế hay không.

Đối với các lần thu thập dữ liệu được render bởi ứng dụng di động hoặc nhạy cảm về địa lý, cơ sở hạ tầng di động 4G có thể là một lựa chọn để phân phối lưu lượng kiểm tra hợp pháp qua các mạng nhà mạng thay vì tập trung mọi yêu cầu vào các địa chỉ dân cư hoặc trung tâm dữ liệu. Evoproxy cung cấp kết nối di động 4G, cổng cá nhân và chia sẻ, quay vòng có thể cấu hình, và truy cập địa lý cho các nhóm quản lý quy trình xã hội, xác thực quảng cáo, nghiên cứu thị trường, và QA. Truy cập Evoproxy để đánh giá xem thiết lập proxy di động của nó có phù hợp với trường hợp sử dụng đã được phê duyệt, chính sách lưu lượng, và yêu cầu kiểm tra địa lý của bạn hay không.